HerrRossi
Fleet Admiral
- Registriert
- Apr. 2014
- Beiträge
- 13.614
Für 3 Personen und bei dem Workload reichen die beiden Grafikkarten locker.
Wenn du vllm einsetzt, solltest du aber kein Q8 nehmen, das ist mW. eher für llama gedacht. Mit vllm kenne ich mich nicht aus, da müsstest du mal recherchieren, was für dich passt. Du könntest auch erstmal mit llama/Ollama starten und gucken, wie es performt, das Setup ist einfacher als vllm. Mit LMStudio kann man das auch mit einer grafischen Oberfläche einstellen.
Sind die PDF schon durch ocr gelaufen? Qwen3 ist wimre ein reines Textmodell. Warum nehmt ihr nicht Qwen3.6 mit Vision? Mit 32b sollte das auch gut in 2 3090ti passen und genug Platz für Kontext lassen.
Bei der Formulierung von Emails solltest du thinking abschalten, sonst wartest du ewig auf die Antwort.
Wenn du vllm einsetzt, solltest du aber kein Q8 nehmen, das ist mW. eher für llama gedacht. Mit vllm kenne ich mich nicht aus, da müsstest du mal recherchieren, was für dich passt. Du könntest auch erstmal mit llama/Ollama starten und gucken, wie es performt, das Setup ist einfacher als vllm. Mit LMStudio kann man das auch mit einer grafischen Oberfläche einstellen.
Sind die PDF schon durch ocr gelaufen? Qwen3 ist wimre ein reines Textmodell. Warum nehmt ihr nicht Qwen3.6 mit Vision? Mit 32b sollte das auch gut in 2 3090ti passen und genug Platz für Kontext lassen.
Bei der Formulierung von Emails solltest du thinking abschalten, sonst wartest du ewig auf die Antwort.