Lokaler KI Server für Automation seht ihr einen Flaschenhals?

Für 3 Personen und bei dem Workload reichen die beiden Grafikkarten locker.

Wenn du vllm einsetzt, solltest du aber kein Q8 nehmen, das ist mW. eher für llama gedacht. Mit vllm kenne ich mich nicht aus, da müsstest du mal recherchieren, was für dich passt. Du könntest auch erstmal mit llama/Ollama starten und gucken, wie es performt, das Setup ist einfacher als vllm. Mit LMStudio kann man das auch mit einer grafischen Oberfläche einstellen.

Sind die PDF schon durch ocr gelaufen? Qwen3 ist wimre ein reines Textmodell. Warum nehmt ihr nicht Qwen3.6 mit Vision? Mit 32b sollte das auch gut in 2 3090ti passen und genug Platz für Kontext lassen.

Bei der Formulierung von Emails solltest du thinking abschalten, sonst wartest du ewig auf die Antwort.
 
  • Gefällt mir
Reaktionen: Dynasty und madmax2010
Dynasty schrieb:
Hinzu kommt das ausgereifte NVIDIA-CUDA-Ökosystem, gerade im LLM-Bereich sehe ich den grössten Vorteil.
Mal die Leistung verglichen, FP8 fehlt halt bei der RTX3090.
Weitere Punkte wären in meinen Augen das Blower Design, mehr VRAM, sowie der günstigere Preis für die AI Pro 9700.

Der Punkt Neuware vs Gebrauchtware sollte man auch beachten.
Cuda ist im LLM Segment des weiteren schon eine längere Zeit kein Alleinstellungsmerkmal mehr.

Mehr als darauf hinweisen kann ich nicht. :schluck:
Dynasty schrieb:
Mit einem Ryzen 9 7950X lassen sich meines Wissens nur zwei GPUs sinnvoll anbinden.
So korrekt.
Dynasty schrieb:
Gibt es überhaupt eine Möglichkeit, ein ähnliches Setup mit 4 Grafikkarten zu betreiben?
Der aktuelle einstieg in Threadrippersysteme wäre der 9955WX.
https://geizhals.de/amd-ryzen-threadripper-pro-9955wx-100-100000725wof-a3531872.html?hloc=de
hinzukommend ~800€ fürs passende Board und ~2.500€ für 64GB RDIMM.

Dafür hätte man die Möglichkeit für vier dGPUs bei voller Anbindung.
 
  • Gefällt mir
Reaktionen: Dynasty
HerrRossi schrieb:
Für 3 Personen und bei dem Workload reichen die beiden Grafikkarten locker.

Wenn du vllm einsetzt, solltest du aber kein Q8 nehmen, das ist mW. eher für llama gedacht. Mit vllm kenne ich mich nicht aus, da müsstest du mal recherchieren, was für dich passt. Du könntest auch erstmal mit llama/Ollama starten und gucken, wie es performt, das Setup ist einfacher als vllm. Mit LMStudio kann man das auch mit einer grafischen Oberfläche einstellen.

Sind die PDF schon durch ocr gelaufen? Qwen3 ist wimre ein reines Textmodell. Warum nehmt ihr nicht Qwen3.6 mit Vision? Mit 32b sollte das auch gut in 2 3090ti passen und genug Platz für Kontext lassen.

Bei der Formulierung von Emails solltest du thinking abschalten, sonst wartest du ewig auf die Antwort.

Vielen Dank für die Info.

Genau, Ollama ist zwar relativ einfach beim benutzen. Ich fand nur den Vorteil von vLLM, die Last offenbar per Tensor-Parallelität auf beide GPUs verteilt und diese dadurch besser ausnutzt. Ich werde aber beide Varianten testen und vergleichen.

OCR habe ich bisher noch nicht integriert. Hier muss ich mir noch überlegen, wie eingehende PDFs aus E-Mails am besten verarbeitet werden können. Du hattest ja Vision vorgeschlagen. Wäre das im Vergleich zum Qwen3-30B-A3B (MoE) mit seinen rund 3 Milliarden aktiven Parametern nicht deutlich langsamer? Oder würdest du für das OCR einen separaten Dienst einsetzen, der beispielsweise primär die CPU nutzt?

Danke auch für den Tipp mit dem Thinking.

KarlsruheArgus schrieb:
Mal die Leistung verglichen, FP8 fehlt halt bei der RTX3090.
Weitere Punkte wären in meinen Augen das Blower Design, mehr VRAM, sowie der günstigere Preis für die AI Pro 9700.

Der Punkt Neuware vs Gebrauchtware sollte man auch beachten.
Cuda ist im LLM Segment des weiteren schon eine längere Zeit kein Alleinstellungsmerkmal mehr.

Mehr als darauf hinweisen kann ich nicht. :schluck:

So korrekt.

Der aktuelle einstieg in Threadrippersysteme wäre der 9955WX.
https://geizhals.de/amd-ryzen-threadripper-pro-9955wx-100-100000725wof-a3531872.html?hloc=de
hinzukommend ~800€ fürs passende Board und ~2.500€ für 64GB RDIMM.

Dafür hätte man die Möglichkeit für vier dGPUs bei voller Anbindung.

Vielen Dank für die Info.

Stimmt, hast du recht. Hab nochmals genauer zu den Grafikkarten recherchiert und werde das auf jeden Fall in meine mit einbeziehen und die anderen Karten ablösen.

Ein Threadripper-System hört sich sehr gut an ist in meiner Liste drin. Vielen Dank für die hilfreichen Tipps!
 
Dynasty schrieb:
Ich fand nur den Vorteil von vLLM, die Last offenbar per Tensor-Parallelität auf beide GPUs verteilt und diese dadurch besser ausnutzt. Ich werde aber beide Varianten testen und vergleichen.
Das kann LMStudio (das auch einen Server aufspannt) mittlerweile auch:
[CUDA] Added tensor parallelism support for multi-GPU model loading
https://lmstudio.ai/changelog/lmstudio-v0.4.15

OCR und Vision: wenn die pdf gescannt oder Tabellen oder mehrere Spalten haben, dann solltest du ein Modell mit "Vision" einsetzen. Qwen3.6 kann das, es ist neuer und imho auch allgemein leistungsstärker als Qwen3. Guck dir das mal an: https://huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF Q8 könnte da aber schon knapp werden, UD-Q6 sollte aber passen. Viel geht dabei nicht verloren.

Beim OCR kommt es auf das Ausgangsmaterial an, wenn das schlecht ist und die ausgespuckten Texte viele Fehler haben, kann es Sinn machen, ein Modell drüber zu jagen. Die Dinger sind recht klein und brauchen nicht viel Leistung, das packt die CPU normalerweise, ein Beispiel wäre glm-ocr, Qwen3.6 kann das mMn. aber auch sehr gut.

Wenn du nicht alles auf Qwen setzen willst, kannst du auch Gemma4 nehmen, die Modelle liegen ziemlich Kopf an Kopf.
 
  • Gefällt mir
Reaktionen: Dynasty
@HerrRossi Vielen Dank für deine Infos.

Ahh, gut zu wissen. Werde ich dann wohl auch testen.

Ich hab auf der Qwen Seite den Chatbot getestet, sehr beeindruckend, bisher keine Fehler entdeckt (Siehe Unten). Q6 reicht auch vollkommen.

Danke für den Tipp, werde ich auch zum testen dann verwenden, falls ich Probleme habe mit Qwen 3.6.


Rot (Ich)

Du bist der Einkaufsassistent der Muster AG. Formuliere eine kurze, höfliche Bestell-Anfrage auf Deutsch an einen Lieferanten. Nutze NUR die folgenden Fakten, erfinde nichts. Fakten: Artikel = Klebeband · Menge = 10'000 Stück · Verpackungseinheit = 10 Stück/Karton (bitte einhalten) · letzter Preis = 1.20 EUR/Stück. Lieferadresse ans Ende der Mail: Muster AG, Musterstrasse 3, 65203 Musterland.



Code:
Betreff: Bestellanfrage Klebeband

Sehr geehrte Damen und Herren,

wir möchten gerne folgende Bestellung bei Ihnen aufgeben:
•    Artikel: Klebeband
•    Menge: 10'000 Stück
•    Verpackungseinheit: 10 Stück/Karton (bitte einhalten)

Bitte bestätigen Sie uns die Bestellung zum letzten Preis von 1.20 EUR/Stück.

Lieferadresse:

Muster AG
Musterstrasse 3
65203 Musterland

Mit freundlichen Grüssen

Einkaufsassistent
Muster AG



Extrahiere aus folgender Lieferanten-Mail die Daten als striktes JSON mit den Feldern artikel, preis, waehrung. Fehlt ein Wert, schreibe null. Gib NUR das JSON aus, keinen weiteren Text. Mail: „Guten Tag, danke für Ihre Anfrage. Der aktuelle Preis für Klebeband beträgt 1.35 EUR pro Stück. Freundliche Grüsse, Kleber Tape Co."


Code:
{
"artikel": "Klebeband",
"preis": 1.35,
"waehrung": "EUR"
}
 
Wo hast du das getestet, bei qwen.ai selber? Da wird natürlich deren frontier Modell 3.7 Max laufen, das es (noch) nicht als open weight gibt.

Du schreibst "Bestell-Anfrage", der Chatbot schickt direkt eine Bestellung raus. War das so gewollt?

Das hier schreibt gemma4:12b auf meinem Mac Air 16GB:

Sehr geehrte Damen und Herren,

hiermit möchten wir eine Bestellung für 10.000 Stück Klebeband anfragen. Bitte beachten Sie die Verpackungseinheit von 10 Stück pro Karton. Der letzte Preis betrug 1,20 EUR pro Stück.

Mit freundlichen Grüßen, Einkaufsassistent Muster AG

Lieferadresse: Muster AG Musterstrasse 3 65203 Musterland


Extrahieren ist auch kein Problem:

Code:
{
  "artikel": "Klebeband",
  "preis": 1.35,
  "waehrung": "EUR"
}
 
  • Gefällt mir
Reaktionen: Dynasty
Warum nicht ein 270K Plus als CPU? Da kostet das 8x/8x Board zwar etwas mehr, aber die CPU ist deutlich günstiger.

Den 7950X verstehe ich auch nicht so ganz, der ist doch inzwischen brutal überteuert, teurer als der schnellere 9950X: Vergleich
 
  • Gefällt mir
Reaktionen: Dynasty und KarlsruheArgus
HerrRossi schrieb:
Wo hast du das getestet, bei qwen.ai selber? Da wird natürlich deren frontier Modell 3.7 Max laufen, das es (noch) nicht als open weight gibt.

Du schreibst "Bestell-Anfrage", der Chatbot schickt direkt eine Bestellung raus. War das so gewollt?

Das hier schreibt gemma4:12b auf meinem Mac Air 16GB:

Sehr geehrte Damen und Herren,

hiermit möchten wir eine Bestellung für 10.000 Stück Klebeband anfragen. Bitte beachten Sie die Verpackungseinheit von 10 Stück pro Karton. Der letzte Preis betrug 1,20 EUR pro Stück.

Mit freundlichen Grüßen, Einkaufsassistent Muster AG

Lieferadresse: Muster AG Musterstrasse 3 65203 Musterland


Extrahieren ist auch kein Problem:

Code:
{
  "artikel": "Klebeband",
  "preis": 1.35,
  "waehrung": "EUR"
}

Vielen Dank für die Info.

Ja genau, qwen.ai selbst. Hab die Version 3.7 gesehen, aber ich der Unterschied zu 3.6 wirklich so groß ?

Ja, die Bestell-Anfrage war nur ein Test.

Wow, nice! Dann kann ich Gemma auch mal zum Testen mit einbeziehen.

Eine andere Frage: Gibt es hier auch eine Art Vergleichstool, ähnlich wie bei vielen anderen Plattformen, bei dem man denselben Prompt gleichzeitig mit verschiedenen Modellen testen kann (z. B. Claude, OpenAI usw.) aber speziell nur für lokale Open-Source-LLMs (KIMI,QWEN,GEMMA etc)

djducky schrieb:
Warum nicht ein 270K Plus als CPU? Da kostet das 8x/8x Board zwar etwas mehr, aber die CPU ist deutlich günstiger.

Den 7950X verstehe ich auch nicht so ganz, der ist doch inzwischen brutal überteuert, teurer als der schnellere 9950X: Vergleich

Vielen Dank für die Infos.

Jetzt wo du es schreibst... Dachte immer Intel sei viel teurer, seit wann sind die mit den Preisen so runter!
Dann würde ich wohl folgendes Board verwenden: MSI MPG Z890 Carbon WIFI...
 
Dynasty schrieb:
Hab die Version 3.7 gesehen, aber ich der Unterschied zu 3.6 wirklich so groß?
Natürlich, weil die nicht angegebene Anzahl an Parametern deutlich höher liegen wird. Übrigens sollte Qwen3.6 27B das qualitativ bessere Modell gegenüber Qwen3.6 35B A3B sein. Musst du vielleicht mal schauen, ob das von der Geschwindigkeit her immer noch passt.
 
  • Gefällt mir
Reaktionen: Dynasty
Dynasty schrieb:
Gibt es hier auch eine Art Vergleichstool, ähnlich wie bei vielen anderen Plattformen, bei dem man denselben Prompt gleichzeitig mit verschiedenen Modellen testen kann (z. B. Claude, OpenAI usw.) aber speziell nur für lokale Open-Source-LLMs (KIMI,QWEN,GEMMA etc)
LMStudio installieren, die entsprechenden Modelle runterladen, sie so einstellen, wie das zB. bei Huggingface angegeben wird und dann deine Prompts im Chat eingeben.
 
Dynasty schrieb:
Jetzt wo du es schreibst... Dachte immer Intel sei viel teurer, seit wann sind die mit den Preisen so runter!
Dann würde ich wohl folgendes Board verwenden: MSI MPG Z890 Carbon WIFI...
Das hat vor Arrow Lake auch noch gestimmt. Intel wurde einfach abgehängt von AMD, deshalb sind sie mit den Sockel 1851 CPUs im Preis runter. Ein 285K ist auch noch fies teuer und lag bei Markteinführung irgendwo um die 600€, aber der Nachfolger vom kleineren Bruder 265K (also der 270K Plus) hat den 285K in der Muilticore-Leistung überholt. Die Folge: Man hat die schnellste Multicore CPU für um die 300€ und der 290K Plus erscheint gar nicht erst. Ein 9950X ist aber quasi gleichauf.

Beim Board musst du auf die Ausstattung schauen, das weiße ist ja deutlich günstiger (Vergleich). Beide Boards haben den manchmal fehleranfälligen intel-Lan-Chip I226-V, das teurere allerdings auch den Killer. Notfalls ist sowas eh schnell gelöst mit ner Karte oder nem USB-Adapter.

Falls du AMD willst, biste halt mit nem 9950X auch besser dran als mit dem 7950X. AMD hat halt den Vorteil der weiteren Aufrüstbarkeit der CPU, aber ich habe nicht das Gefühl, dass dir das hier wichtig ist.
 
Dynasty schrieb:
Aktuell ist folgender Tech-Stack geplant: MCP, n8n, Open WebUI, NocoDB, PostgreSQL., vLLM, Qwen.
Ich habe am Wochenende mein System endlich zum Laufen gebracht. 😊 Auch wenn es eine Menge Spaß gemacht hat, lief natürlich nicht alles direkt out of the box – insgesamt hat mich die Einrichtung dann doch fast einen ganzen Tag incl. Nacht gekostet.

Aktuell nutze ich folgenden Tech-Stack:
  • Debian 13
  • Docker Compose
  • Open WebUI
  • PostgreSQL
  • Qdrant
  • vLLM
Modelle:
  • Qwen3 27B
  • Qwen3 8B
  • DeepSeek Coder
  • Gemma 3
  • Qwen2.5-VL (Vision)
Was mir aktuell noch etwas Kopfzerbrechen bereitet, ist die maximale Kontextgröße bzw. der VRAM-Bedarf. Gestartet bin ich mit 8k Tokens, anschließend auf 16k erhöht und mittlerweile experimentiere ich mit rund 55k Tokens. Mit dem Qwen3 27B funktioniert das auf meiner RTX 4090 gerade noch so – der VRAM ist dann praktisch vollständig belegt. DeepSeek Coder läuft mit dieser Kontextgröße dagegen bereits nicht mehr.

Deshalb mal eine Frage an die Runde: Wenn man später auf zwei GPUs erweitert – erhöht sich dadurch auch die maximal nutzbare Kontextgröße bzw. Token-Anzahl, oder bleibt diese letztlich durch den Speicher einer einzelnen GPU begrenzt? Hat hier jemand praktische Erfahrungen mit vLLM und Multi-GPU-Setups?
 
Zurück
Oben