Lokaler KI Server für Automation seht ihr einen Flaschenhals?

KarlsruheArgus schrieb:
Weil teurer als die 9700 Pro...
Er schreibt "zur Verfügung habe", das interpretiere ich so, dass die Karte schon da ist.
Ergänzung ()

Garmor schrieb:
Das muss das Modell aber auch hergeben.
 
  • Gefällt mir
Reaktionen: Dynasty
  • Gefällt mir
Reaktionen: Dynasty
Dann wurde eine mittlerweile vllt. verkauft...
 
  • Gefällt mir
Reaktionen: Dynasty und KarlsruheArgus
@HerrRossi
Müsste der TE dann nochmal beantworten, dass entzieht sich meiner Kenntniss. :schluck:
 
  • Gefällt mir
Reaktionen: Dynasty
HerrRossi schrieb:
Warum hast du es denn nicht zuerst mit der einzelnen 3090 ti probiert? Was willst du mit 64GB VRAM erreichen, welches Modell willst du nutzen? Oder sollen mehrere Modelle gleichzeitig genutzt werden?

Ich vermute, dass du soviel VRAM überhaupt nicht brauchst. Klar, Qwen3.6 27B dense passt mit Q8 ins VRAM, das ergibt etwas bessere Qualität der Antworten als mit Q4. Auch Qwen3.6-35B-A3B passt komplett ins VRAM und muss nicht ins System RAM offloaden, das bringt mehr token/s, da wäre die Frage, ob das so kritisch ist.

FP16 dense oder Modelle mit >100B Parametern, die wirklich mehr Qualität oder mehr Wissen versprechen, passen jetzt auch nicht ins VRAM, da müsstest du dann auch ein MoE Modell finden, das du offloaden kannst, genug System RAM vorausgesetzt.

Und du handelst dir jetzt mit AMD mehr Konfigurationsaufwand und etwas weniger Leistung (1008GB/s vs. 645GB/s) ein. Sicher das ist alles zu bewältigen und die Performance ist trotzdem okay, aber CUDA fehlt, das musst du immer beachten, auch bei der Auswahl der Modelle, eines mit zB. NVFP4 funktioniert nur auf Blackwell, da hätte dir die 3090 allerdings auch nicht geholfen.

AMD hat für die eigene AI Max+ 395 Kiste einen Softwarestack aufgebaut, da würde ich mal recherchieren, ob da zumindest eine Blaupause verfügbar ist, die du nutzen kannst.


Vielen Dank für die Infos.

Genau, ich möchte den Qwen3.6 35B A3B (MoE) mit Q8 nutzen, wie du erwähnt hast. Da wir sowieso ein entsprechendes Budget eingeplant haben, möchte ich das Maximum herausholen. In diesem Fall kommt für mich eigentlich nur Q8 infrage. Ich habe berechnet, dass das Modell ungefähr 37 GB VRAM benötigt, wodurch ich noch rund 27 GB Reserve für den Kontext und weitere Anwendungen habe.

Du hast natürlich recht, dass es für unseren aktuellen Workflow nicht kritisch ist und das Setup wahrscheinlich etwas überdimensioniert ist. Allerdings haben wir dadurch die Möglichkeit, zukünftig weitere Chatbots / Modelle etc einzusetzen und die vorhandene Reserve zu nutzen. Preislich ist das für uns auch im Rahmen.

100B Modelle kommen aktuell noch nicht infrage.

Ich hoffe jetzt einfach, dass AMD bei den Treibern und der Software-Unterstützung in nächster Zeit noch deutlich aufholt. Die Karten unterstützen FP8, was ebenfalls einen Vorteil bei der Geschwindigkeit bringen kann.

Perfekt, vielen Dank auch für den Tipp bezüglich des AMD Software Stacks. Werde heute anfangen zu recherchieren.



Drahminedum schrieb:
AMD veröffentlicht mittlerweile sog. Playbooks wo man seine Hardware auswählt und dann Anleitungen bekommt:
https://developer.amd.com/playbooks/

Vielen Dank für die Infos!



KarlsruheArgus schrieb:
Du hättest ja erstmal eine Pro 9700 testen können, aber ok. :p
Ergänzung ()


Weil teurer als die 9700 Pro, weniger VRAM und keine native FP8 Unterstützung.

Vielen Dank für die Info.

Würde gerne den Qwen3.6 35B A3B (MoE) mit Q8 nutzen und noch Reserve haben für Kontext und evt weitere Projekte mit Chatbot etc..

Genau, die 3090 kosten bei mir Gebraucht auch fast gleich viel wie ein 0700 Pro.
KarlsruheArgus schrieb:
HerrRossi schrieb:
Dann wurde eine mittlerweile vllt. verkauft...
KarlsruheArgus schrieb:
@HerrRossi
Müsste der TE dann nochmal beantworten, dass entzieht sich meiner Kenntniss. :schluck:

Beim Post 35 habe ich noch dazu geschrieben:

EDIT:
Kurz zur Grafikkarte: Ich habe festgestellt, dass ich wohl doch nur noch eine 3090 zur Verfügung habe. Daher möchte ich diese aktuell komplett außen vor lassen.
 
  • Gefällt mir
Reaktionen: KarlsruheArgus
Ich drücke dir die Daumen, dass die Qualität der Antworten für das reicht, was du machen willst. Du darfst dich nicht von den Antworten der Frontier-Modell blenden lassen, die sind deutlich besser als das, was lokale Modelle derzeit leisten können. Man ist mit open weight Modellen ungefähr ein Jahr zurück und mit 35 Milliarden Parametern ist das zusätzlich noch stark eingedampft, man schätzt zB. Opus 5 auf fünf Billionen Parameter.
Ich will dir deinen Plan nicht madig machen, ich bin selbst großer Fan von lokalem AI, ich möchte nur deine Erwartungen etwas im Rahmen halten.
 
Zurück
Oben