Lokaler KI Server für Automation seht ihr einen Flaschenhals?

Dynasty

Ensign
Registriert
Dez. 2013
Beiträge
254
Hallo zusammen,

ich stelle aktuell einen lokalen KI-Server für mich zusammen und würde gerne eure Meinung zur Hardware hören, bevor ich den Rest bestelle.

Anwendungsfall: n8n übernimmt die Orchestrierung, Ollama führt Qwen3-30B-A3B (Q8) aus und PostgreSQL + pgvector werden für RAG genutzt. Typischer Ablauf: n8n verarbeitet ein Ereignis, das Modell erstellt z. B. eine Lieferanten-E-Mail, der Kollege gibt sie frei und n8n versendet sie. Später soll noch ein Knowledge Chatbot entstehen, über den ich Fragen stellen kann. Das LLM beantwortet diese anhand der Informationen und Daten aus der Datenbank

Geplante Hardware:

  • CPU: AMD Ryzen 9 7950X (16Core 4.5GHZ)
  • GPU: 2× RTX 3090Ti (48 GB VRAM)
  • RAM: 64 GB DDR5-6000 (2×32 GB Kingston Fury Beast)
  • Mainboard: ASUS ProArt B850-Creator WiFi
  • SSD: Samsung 990 Pro 2000 GB, M.2 2280
Ich habe das Pro Art B850 gewählt, weil es mit Ryzen 7000 beide GPUs mit x8/x8 direkt über die CPU betreibt.
Viele B650-Boards bieten bei zwei GPUs nur x8/x4.

Meine Fragen:

  • Seht ihr bei diesem Setup einen Flaschenhals?
  • Würdet ihr vor dem Kauf noch etwas an der Hardware ändern?
  • Das Mainboard unterstützt x8/x8 für beide RTX 3090. Ist das eurer Meinung nach die beste Lösung, um beide GPUs optimal auszunutzen, oder würdet ihr etwas anderes empfehlen?
Budget war geplant: 7000-8000 Euro

Danke für euer Feedback!
 
Möchtest du mit dem PC spielen?
Nein
Möchtest du den PC für Bild-/Musik-/Videobearbeitung oder CAD nutzen?
Nein
Hast du besondere Anforderungen oder Wünsche?
LLM
Wieviele und welche Monitore möchtest du nutzen?
Keine
Hast du noch einen alten PC, dessen Komponenten teilweise weitergenutzt werden könnten?
Nein
Wie viel Geld bist du bereit auszugeben?
8000.Euro
Wann möchtest du den PC kaufen?
Sofort
Möchtest du den PC..
  1. selbst zusammenbauen
Bestätigung
  1. Ich habe den Fragebogen bestmöglich beantwortet und verstehe, dass mein Thread ohne diese Angaben geschlossen werden kann.
Die Vram Bandbreite ist der Flaschenhals. Daran kannst du aber nichts ändern. Ist dich eine faire config
 
  • Gefällt mir
Reaktionen: AAS und Dynasty
Wäre es nicht sinnvoller, jetzt EINE 5090 zu verbauen und dann, sollte es nötig sein und die Preise wieder "normal" sind, eine Weiter zu kaufen?
 
  • Gefällt mir
Reaktionen: Dynasty
Oder eine RTX6000 verbauen.. Sprengt aber das Budget :D
 
  • Gefällt mir
Reaktionen: Dynasty
Die 16 Core CPU muss halt nicht sein ausser du findest dafür einen tatsächlichen Use Case. Wie oben beschrieben ist Speicherbandbreite dein Problem. Wennst es zB für Coding nutzt und der KV Cache durch größere Context Windows anschwillt wird es expondentiell langsamer. Rechnest den Verbrauch mit ein ists wahrscheinlich bei 8k Euro sinnvoller 2x DGX Spark aneinander zu koppeltn und den "gratis" Speichercontext mit zu nehmen. Die Workstation hat dann halt explizite Vorteile wenn CPU Compute wichtiger wird.

Ai Context:

Tatsächliche Benchmarks (2× DGX Spark vs. 2× RTX 3090)​

1.​

Ein direkter Vergleich zeigt:thinksmart

  • 1× DGX Spark (128 GB): ~40–80 tok/s für 30–70B-Modelle (Q4)
  • 4× RTX 3090 (96 GB): ~100–150 tok/s für 30–70B-Modelle (Q4)
  • Fazit: 4× 3090 sind deutlich schneller als 1× DGX Spark für Modelle <100B

2.​

Reale Dual-Node-Ergebnisse:developer.nvidia+1

  • GPT-OSS-120B: 55 tok/s (dual) vs. 36 tok/s (single)
  • Qwen3-VL-32B: 12 tok/s (dual) vs. 7 tok/s (single)
  • Qwen3-30B-A3B: 75 tok/s (dual) vs. 64 tok/s (single)

3.​

  • 7B-Modelle: 160–220 tok/s (Q4)ywian+1
  • 13B-Modelle: 60–110 tok/s (Q4)gpugrind+1
  • 70B-Modelle: 10–30 tok/s (Q2–Q3, stark quantisiert)thinksmart+1

Korrigierte Vergleichstabelle​

Modellgröße2× RTX 3090 (48 GB)2× DGX Spark (256 GB)
Modellgröße2× RTX 3090 (48 GB)2× DGX Spark (256 GB)
7B (Q4)~160–220 tok/s~100–150 tok/s
13B (Q4)~60–110 tok/s~120–180 tok/s (besser bei großen Batches)
30B (Q4)~30–60 tok/s~75–100 tok/s (dual)
70B (Q2–Q3)~10–30 tok/s~50–80 tok/s (dual)
120B+OOM oder extrem langsam~55 tok/s (dual)


Wichtige Korrekturen​

  1. 2× RTX 3090 sind schneller für Modelle <30B (bessere Rechenleistung, höhere Clocks) – DGX Spark gewinnt erst bei Modellen >100B durch VRAM-Pooling.sectorhq+1
  2. 2× DGX Spark bringen für kleinere Modelle keinen Speedup – bei 30B nur ~1,2× (75 vs. 64 tok/s).forums.developer.nvidia
  3. DGX Spark ist effizienter, aber nicht schneller im klassischen Sinn – 120 W vs. 700 W für ähnliche Performance bei 30B.storagereview+1

Fazit​

Die ersten Zahlen waren zu optimistisch für DGX Spark. Realistisch:

  • Für 7B–30B: 2× RTX 3090 sind schneller (1,5–2× tok/s)
  • Für 70B–120B+: 2× DGX Spark sind deutlich überlegen (laufen überhaupt erst)
  • Effizienz: DGX Spark ist 5–6× sparsamer, aber kein Performance-King
 
  • Gefällt mir
Reaktionen: iron_monkey, Dynasty und CubeID
madmax2010 schrieb:
Die Vram Bandbreite ist der Flaschenhals. Daran kannst du aber nichts ändern. Ist dich eine faire config
Super, vielen Dank für deine Info. Ja für den Anfang reicht es mal.
Ergänzung ()

TG3 schrieb:
Wäre es nicht sinnvoller, jetzt EINE 5090 zu verbauen und dann, sollte es nötig sein und die Preise wieder "normal" sind, eine Weiter zu kaufen?

Vielen Dank für die Info. Der kostet über 4K und für meine 2X 3090 würde ich jetzt 2K zahlen.

Ultra_Force schrieb:
Oder eine RTX6000 verbauen.. Sprengt aber das Budget :D
Vielen Dank für die Info. Ja, defintiv :)

steirerblut schrieb:
Die 16 Core CPU muss halt nicht sein ausser du findest dafür einen tatsächlichen Use Case. Wie oben beschrieben ist Speicherbandbreite dein Problem. Wennst es zB für Coding nutzt und der KV Cache durch größere Context Windows anschwillt wird es expondentiell langsamer. Rechnest den Verbrauch mit ein ists wahrscheinlich bei 8k Euro sinnvoller 2x DGX Spark aneinander zu koppeltn und den "gratis" Speichercontext mit zu nehmen. Die Workstation hat dann halt explizite Vorteile wenn CPU Compute wichtiger wird.

Ai Context:

Vielen Dank für die Infos!

Ich habe bewusst den 16-Kerner gewählt, da n8n ebenfalls einiges an CPU-Leistung benötigt und der Preisunterschied von rund 200 Euro ist dabei für mich vertretbar und nicht der mega Killer.

Der KV-Cache könnte zwar etwas knapp werden, aber ich denke, das ist für unseren Anwendungsfall kein grosses Problem. Wir werden das Modell hauptsächlich zum Formulieren von E-Mails, allgemeinen Texten und zum Auslesen Anzahl von PDFs (ca. 10 pro Tag) einsetzen denke ehr weniger für Coding.

Soweit ich weiss, aktiviert das Qwen Modell pro Token nur etwa 3 Milliarden der insgesamt 30 Milliarden Parameter. Dadurch ist es nochmals effizienter.

Den DGX Spark werden wir uns auf jeden Fall merken entweder für ein zukünftiges Projekt oder als möglicher Ersatz für dieses System.
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: iron_monkey und steirerblut
madmax2010 schrieb:
Die Vram Bandbreite ist der Flaschenhals. Daran kannst du aber nichts ändern. Ist dich eine faire config
Sehe ich auch so.
Ich würde auch noch die Radeon AI PRO R9700 anschauen, wenn man nicht wirklich auf Nvidia angewiesen ist.
 
  • Gefällt mir
Reaktionen: Dynasty und KarlsruheArgus
Ich würde nur eine Karte mit 32 GB nehmen, zum Beispiel die schon genannte Radeon AI PRO R9700 oder eine Intel arc pro B70
Die 35B Modelle haben um die 20-25 GB in Q4 dann hast du noch Luft für Kontext.

Wenn du bei dual GPUs bleiben willst würde ich vLLM und nicht ollama nutzen, weil es besser optimiert ist!
 
  • Gefällt mir
Reaktionen: Dynasty
@Der_Dicke82
Von der ARC Pro B70 würde ich abraten, wenn man sich nicht mit dem Intel Ökosystem auseinandersetzen will und etwas haben will, dass Out off the Box laufen soll. (Habe selbst zwei Arc B50 Pro)
 
  • Gefällt mir
Reaktionen: Dynasty, Der_Dicke82 und madmax2010
  • Gefällt mir
Reaktionen: Dynasty
Wenn das n8n RAG Automatisierung ist, warum nimmst du dann teure GPUs und kein DGX Spark oder AMD 395 mit deutlich mehr dual use RAM?
 
  • Gefällt mir
Reaktionen: Dynasty
@Kuestennebel79
Ich hätte die Strix 128er jetzt als zu langsam angesehn bei den Tocken/Sec. .
Die Idee hatte ich urpsrünglich nämlich auch hab Sie dann jedoch verworfen.

Meinst du das reicht beim obigen Workflow ?
 
  • Gefällt mir
Reaktionen: Dynasty
Naja, bei einem automatischem Workflow ist der Speed doch nicht so relevant. Ob die Mail eine Minute später rausgeht, ist ggf egal?
Wäre halt deutlich günstiger.
 
  • Gefällt mir
Reaktionen: Dynasty, Der_Dicke82 und AAS
  • Gefällt mir
Reaktionen: Dynasty
Kuestennebel79 schrieb:
Naja, bei einem automatischem Workflow ist der Speed doch nicht so relevant. Ob die Mail eine Minute später rausgeht, ist ggf egal?
Wäre halt deutlich günstiger.
Sehe ich auch so.
 
  • Gefällt mir
Reaktionen: Dynasty
Ich würde mir da schwer tun für den Business Einsatz irgendwelche alte Consumer Grafikkarten, die im worstcase schon über drei Jahre in irgendwelchen Lagern rumlagen zu zweckentfremden.
Zumal ich die 3090(Ti) neu auch nur erst ab ca. 2K pro Stück finde. (Gebraucht würde ich erst recht davon abraten, ggf. steckten die Teile jahrelang in irgendwelchen Miningrigs oder wurden mit extrem OC gequält).
Wenn alles gut läuft ist es prima, aber wenn kurze Zeit nach dem Kauf irgendwas nicht geht und sei es nur mangelnder Softwaresupport für die mittlerweile recht betagte (und nie für den professionellen KI-Einsatz ausgelegte) Hardware, wird dein Chef dich dafür verantwortlich machen, was für einen "Schrott" du gekauft hast.
Konntest du vorab schon überprüfen ob der geplante Workflow überhaupt sauber auf zwei Grafikkarten aufteilbar ist und darüber gut skaliert um die 2x24GB der 3090 als gebündelte 48GB zu nutzen?

Alternativen wären ggf. (als erstmal einzelne Karten) eine "Intel Arc Pro B70" mit 32GB ab 1250€, eine "AMD Radeon AI PRO R9700" mit ebenfalls 32GB ab 1450€ und mehr Leistung oder eine "Nvidia RTX Pro 5000 Blackwell" mit 48GB ECC RAM für 5650€. Nvidias KI-Softwarestack für ihre profi Grafikkarten scheint aktuell noch am weitesten ausgereift zu sein, da läuft es vermutlich am ehesten ohne mögliche Problemchen beim einrichten und betrieb. (Das lassen sie sich aber eben auch fürstlich bezahlen.)
 
  • Gefällt mir
Reaktionen: Dynasty
Dynasty schrieb:
Würdet ihr vor dem Kauf noch etwas an der Hardware ändern?
Hab noch was vergessen. :p
Dynasty schrieb:
RAM: 64 GB DDR5-6000 (2×32 GB Kingston Fury Beast)
Das ist RAM OC, freigegeben für einen stabilen Betrieb sind von AMD beim Ryzen 9 7950X bei zwei Sticks max. 5200 MT/s bei 1.1V in einem SPD Profil, Timings nach Norm DDR5, handelsüblich wären CL42.

RAM Kapazität:
• Immer zwei Sticks, keine Vollbestückung (vier Sticks)
• Gaming: 32GB bis 48GB
• Strategie + Simulatoren: 64GB
• Arbeit: 32GB bis 128GB+

RAM OC:
AMD Ryzen 7000er/9000er: 6000 MT/s CL26 bis CL30
Intel 200er: 6400 MT/s CL28 bis CL32

Nachteile:
• Längere Bootzeiten
• Stabiler Betrieb Herstellerseitig nicht garantiert
• Inkonsistente Mehrleistung im CPU Limit
• Potentieller Garantieverlust, unbedingt Profilform und Profileinstellungen beim Prozessorhersteller prüfen.
• Mehrleistung nicht linear zum Takt und oder Latenz

Vorteile:
• Mehrleistung im CPU Limit

RAM nach Herstellerspezifikation und Norm DDR5 (JEDEC):
AMD Ryzen 7000er/8000er:
5200 MT/s CL42 1.1V SPD Profil
AMD Ryzen 9000er:
5600MT/s CL46 1.1V SPD Profil
Intel 200er:
5600 MT/s CL46 1.1V SPD Profil
6400 MT/s CL52 1.1V SPD Profil bei nur zwei verfügbaren RAM Slots als CUDIMM

Nachteile:
• Weniger Leistung im CPU Limit

Vorteile:
• Stabiler Betrieb herstellerseitig garantiert
• Niedriger Stromverbrauch im Leerlauf
• Kürzer Bootzeiten
• Kein potentieller Garantieverlust, keine Prüfung des Profils nötig.
Welches PSU ist geplant ?

Edit:
Vorschläge meinerseits:
C1500
HX1200I Shift
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Dynasty
Dynasty schrieb:
Hallo zusammen,

ich stelle aktuell einen lokalen KI-Server für mich zusammen und würde gerne eure Meinung zur Hardware hören, bevor ich den Rest bestelle.

Anwendungsfall: n8n übernimmt die Orchestrierung, Ollama führt Qwen3-30B-A3B (Q8) aus und PostgreSQL + pgvector werden für RAG genutzt. Typischer Ablauf: n8n verarbeitet ein Ereignis, das Modell erstellt z. B. eine Lieferanten-E-Mail, der Kollege gibt sie frei und n8n versendet sie. Später soll noch ein Knowledge Chatbot entstehen, über den ich Fragen stellen kann. Das LLM beantwortet diese anhand der Informationen und Daten aus der Datenbank

Geplante Hardware:

  • CPU: AMD Ryzen 9 7950X (16Core 4.5GHZ)
  • GPU: 2× RTX 3090Ti (48 GB VRAM)
  • RAM: 64 GB DDR5-6000 (2×32 GB Kingston Fury Beast)
  • Mainboard: ASUS ProArt B850-Creator WiFi
  • SSD: Samsung 990 Pro 2000 GB, M.2 2280
Ich habe das Pro Art B850 gewählt, weil es mit Ryzen 7000 beide GPUs mit x8/x8 direkt über die CPU betreibt.
Viele B650-Boards bieten bei zwei GPUs nur x8/x4.

Meine Fragen:

  • Seht ihr bei diesem Setup einen Flaschenhals?
  • Würdet ihr vor dem Kauf noch etwas an der Hardware ändern?
  • Das Mainboard unterstützt x8/x8 für beide RTX 3090. Ist das eurer Meinung nach die beste Lösung, um beide GPUs optimal auszunutzen, oder würdet ihr etwas anderes empfehlen?
Budget war geplant: 7000-8000 Euro

Danke für euer Feedback!
Hi,

ich habe ein sehr ähnliches Setup gerade in Vorbereitung als KI Server, 5950x; 64gb; b550; WD850 s2TB aber nur 1x 4090.

Darf ich fragen wie/was du plants mit der Hardware aufzusetzen? Welches OS, Agents, Model, usw? Rein aus interesse :)

LG
 
  • Gefällt mir
Reaktionen: Dynasty
Dynasty schrieb:
Wir werden das Modell hauptsächlich zum Formulieren von E-Mails, allgemeinen Texten und zum Auslesen Anzahl von PDFs (ca. 10 pro Tag) einsetzen denke ehr weniger für Coding.
Wie viele Leute werden daran gleichzeitig arbeiten?

Soweit ich weiss, aktiviert das Qwen Modell pro Token nur etwa 3 Milliarden der insgesamt 30 Milliarden Parameter. Dadurch ist es nochmals effizienter.
Das ist richtig, es muss aber trotzdem komplett im VRAM liegen. Man kann aber auch offloaden, ohne zu viel Leistung zu verlieren, hier wird das gut erklärt:
 
  • Gefällt mir
Reaktionen: Dynasty und madmax2010
Der_Dicke82 schrieb:
Ich würde nur eine Karte mit 32 GB nehmen, zum Beispiel die schon genannte Radeon AI PRO R9700 oder eine Intel arc pro B70
Die 35B Modelle haben um die 20-25 GB in Q4 dann hast du noch Luft für Kontext.

Wenn du bei dual GPUs bleiben willst würde ich vLLM und nicht ollama nutzen, weil es besser optimiert ist!
Vielen Dank für die Info. Sehr guter Punkt vLLM ist wohl noch besser für meine Anwednung geeignet!


KarlsruheArgus schrieb:
VRAM

Zweimal die AI Pro R9700 https://geizhals.de/powercolor-radeon-ai-pro-r9700-a3504726.html?hloc=de

Edit:
Man hätte mehr Puffer und eine native FP8 Unterstützung die die RTX3090 nicht hat.
(Gerne bitte nochmal nachprüfen.)
Vielen Dank für die Info.

Die 3090 haben mit t 936 GB/s die höhere Speicherbandbreite und für unser Modell problemlos in die 48 GB VRAM passt. Hinzu kommt das ausgereifte NVIDIA-CUDA-Ökosystem, gerade im LLM-Bereich sehe ich den grössten Vorteil.


Kuestennebel79 schrieb:
Wenn das n8n RAG Automatisierung ist, warum nimmst du dann teure GPUs und kein DGX Spark oder AMD 395 mit deutlich mehr dual use RAM?

Vielen Dank für die Info.

Bandbreite von 3090: 936 GB/s R9700: 640 GB/s

KarlsruheArgus schrieb:
Müsste der TE dann beantworten. :schluck:

Vielen Dank für dein Post. Komplett Wurst, Hauptsache die Qualität stimmt :)

Xes schrieb:
Ich würde mir da schwer tun für den Business Einsatz irgendwelche alte Consumer Grafikkarten, die im worstcase schon über drei Jahre in irgendwelchen Lagern rumlagen zu zweckentfremden.
Zumal ich die 3090(Ti) neu auch nur erst ab ca. 2K pro Stück finde. (Gebraucht würde ich erst recht davon abraten, ggf. steckten die Teile jahrelang in irgendwelchen Miningrigs oder wurden mit extrem OC gequält).
Wenn alles gut läuft ist es prima, aber wenn kurze Zeit nach dem Kauf irgendwas nicht geht und sei es nur mangelnder Softwaresupport für die mittlerweile recht betagte (und nie für den professionellen KI-Einsatz ausgelegte) Hardware, wird dein Chef dich dafür verantwortlich machen, was für einen "Schrott" du gekauft hast.
Konntest du vorab schon überprüfen ob der geplante Workflow überhaupt sauber auf zwei Grafikkarten aufteilbar ist und darüber gut skaliert um die 2x24GB der 3090 als gebündelte 48GB zu nutzen?

Alternativen wären ggf. (als erstmal einzelne Karten) eine "Intel Arc Pro B70" mit 32GB ab 1250€, eine "AMD Radeon AI PRO R9700" mit ebenfalls 32GB ab 1450€ und mehr Leistung oder eine "Nvidia RTX Pro 5000 Blackwell" mit 48GB ECC RAM für 5650€. Nvidias KI-Softwarestack für ihre profi Grafikkarten scheint aktuell noch am weitesten ausgereift zu sein, da läuft es vermutlich am ehesten ohne mögliche Problemchen beim einrichten und betrieb. (Das lassen sie sich aber eben auch fürstlich bezahlen.)


VIelen Dank für die Info.

Ich erhalte die Karte günstiger und es geht hier auch vorallem um die Bandbreite die bei 3090 sehr stark ist.
Bezüglich Auslastung ist alles konfigruationssache bsp mit dem vLLM verteilt die Last über Tensor-Parallelität. Beide Karten rechnen also gleichzeitig an derselben Anfrage — die Auslastung ist gleichmässig auf beiden. Danke nochmal an @Der_Dicke82 für den Tipp mit vLLM.



KarlsruheArgus schrieb:
Hab noch was vergessen. :p

Das ist RAM OC, freigegeben für einen stabilen Betrieb sind von AMD beim Ryzen 9 7950X bei zwei Sticks max. 5200 MT/s bei 1.1V in einem SPD Profil, Timings nach Norm DDR5, handelsüblich wären CL42.

RAM Kapazität:
• Immer zwei Sticks, keine Vollbestückung (vier Sticks)
• Gaming: 32GB bis 48GB
• Strategie + Simulatoren: 64GB
• Arbeit: 32GB bis 128GB+

RAM OC:
AMD Ryzen 7000er/9000er: 6000 MT/s CL26 bis CL30
Intel 200er: 6400 MT/s CL28 bis CL32

Nachteile:
• Längere Bootzeiten
• Stabiler Betrieb Herstellerseitig nicht garantiert
• Inkonsistente Mehrleistung im CPU Limit
• Potentieller Garantieverlust, unbedingt Profilform und Profileinstellungen beim Prozessorhersteller prüfen.
• Mehrleistung nicht linear zum Takt und oder Latenz

Vorteile:
• Mehrleistung im CPU Limit

RAM nach Herstellerspezifikation und Norm DDR5 (JEDEC):
AMD Ryzen 7000er/8000er:
5200 MT/s CL42 1.1V SPD Profil
AMD Ryzen 9000er:
5600MT/s CL46 1.1V SPD Profil
Intel 200er:
5600 MT/s CL46 1.1V SPD Profil
6400 MT/s CL52 1.1V SPD Profil bei nur zwei verfügbaren RAM Slots als CUDIMM

Nachteile:
• Weniger Leistung im CPU Limit

Vorteile:
• Stabiler Betrieb herstellerseitig garantiert
• Niedriger Stromverbrauch im Leerlauf
• Kürzer Bootzeiten
• Kein potentieller Garantieverlust, keine Prüfung des Profils nötig.
Welches PSU ist geplant ?

Edit:
Vorschläge meinerseits:
C1500
HX1200I Shift
Vielen Dank für die Info.

Super, die Hinweise zum RAM und Netzteil haben wir ebenfalls notiert. Beim Netzteil hatten wir ursprünglich an das Corsair HX1500i gedacht, das aktuell rund 220 € kostet. Eventuell wird es aber doch das Corsair C1500, da das HX1500i recht groß ist und möglicherweise nicht in das geplante Gehäuse passt.


Das wäre das Gehäuse:
https://www.caseking.de/silverstone-sst-rm41-506-rackmount-server-4u-schwarz/GESV-483.html



DellTree schrieb:
Hi,

ich habe ein sehr ähnliches Setup gerade in Vorbereitung als KI Server, 5950x; 64gb; b550; WD850 s2TB aber nur 1x 4090.

Darf ich fragen wie/was du plants mit der Hardware aufzusetzen? Welches OS, Agents, Model, usw? Rein aus interesse :)

LG


Vielen Dank für deine Infos.


Aktuell ist folgender Tech-Stack geplant: MCP, n8n, Open WebUI, NocoDB, PostgreSQL., vLLM, Qwen.


HerrRossi schrieb:
Wie viele Leute werden daran gleichzeitig arbeiten?


Das ist richtig, es muss aber trotzdem komplett im VRAM liegen. Man kann aber auch offloaden, ohne zu viel Leistung zu verlieren, hier wird das gut erklärt:

Vielen Dank für deine Info.

Maximal 3 Personen. Danke für das Video.
Ergänzung ()

Noch eine andere Frage:

Gibt es überhaupt eine Möglichkeit, ein ähnliches Setup mit 4 Grafikkarten zu betreiben? Soweit ich weiß, ist hier die CPU bzw. die Anzahl der verfügbaren PCIe-Lanes der limitierende Faktor. Mit einem Ryzen 9 7950X lassen sich meines Wissens nur zwei GPUs sinnvoll anbinden.

Müsste man dafür auf eine andere CPU- und Mainboard-Plattform wechseln?

Vielen Dank!
 
Zuletzt bearbeitet:
Zurück
Oben