NimmEinenKeks
Newbie
- Registriert
- Juli 2026
- Beiträge
- 3
Hallo zusammen,
ich beschäftige mich aktuell mit dem Aufbau eines lokalen KI-Servers für Inferenz und prüfe dabei unter anderem die Intel Arc Pro B60 mit 24 GB VRAM.
Der Einsatzzweck wäre ausdrücklich kein Gaming und zunächst auch kein Training größerer Modelle. Geplant ist ein möglichst stabiler, dauerhaft nutzbarer Inferenzserver für lokale Sprachmodelle, strukturierte JSON-Ausgaben und automatisierte Analyseaufgaben. Typische Modellgrößen wären etwa 20B bis 30B Parameter in geeigneter Quantisierung. Der Server soll später über eine lokale API angesprochen werden.
Bevor ich Hardware kaufe, teste ich den Anwendungsfall zunächst auf Cloud-GPUs mit 24 GB VRAM. Als lokale Lösung wäre die B60 wegen des Speicherausbaus und des voraussichtlich niedrigeren Preises gegenüber vielen Nvidia-Alternativen grundsätzlich interessant. Entscheidend ist für mich aber nicht die theoretische Rechenleistung, sondern ob der Software-Stack inzwischen zuverlässig genug für einen produktiven Dauerbetrieb ist.
Mich interessieren daher vor allem praktische Erfahrungen zu folgenden Punkten:
Hat jemand die B60 oder eine vergleichbare Intel-Arc-Pro-Karte bereits für lokale LLM-Inferenz im Einsatz? Besonders hilfreich wären konkrete Angaben zum verwendeten Modell, Backend, Betriebssystem, Treiberstand, Quantisierung und zur erreichten Geschwindigkeit.
ich beschäftige mich aktuell mit dem Aufbau eines lokalen KI-Servers für Inferenz und prüfe dabei unter anderem die Intel Arc Pro B60 mit 24 GB VRAM.
Der Einsatzzweck wäre ausdrücklich kein Gaming und zunächst auch kein Training größerer Modelle. Geplant ist ein möglichst stabiler, dauerhaft nutzbarer Inferenzserver für lokale Sprachmodelle, strukturierte JSON-Ausgaben und automatisierte Analyseaufgaben. Typische Modellgrößen wären etwa 20B bis 30B Parameter in geeigneter Quantisierung. Der Server soll später über eine lokale API angesprochen werden.
Bevor ich Hardware kaufe, teste ich den Anwendungsfall zunächst auf Cloud-GPUs mit 24 GB VRAM. Als lokale Lösung wäre die B60 wegen des Speicherausbaus und des voraussichtlich niedrigeren Preises gegenüber vielen Nvidia-Alternativen grundsätzlich interessant. Entscheidend ist für mich aber nicht die theoretische Rechenleistung, sondern ob der Software-Stack inzwischen zuverlässig genug für einen produktiven Dauerbetrieb ist.
Mich interessieren daher vor allem praktische Erfahrungen zu folgenden Punkten:
- Wie stabil läuft die B60 aktuell unter Linux?
- Welche Distribution und welche Treiberversionen funktionieren zuverlässig?
- Wie gut ist die Unterstützung in llama.cpp, Ollama, vLLM oder vergleichbaren Inferenzlösungen?
- Ist ein sauberer Betrieb über Docker möglich?
- Funktionieren gängige GGUF-Quantisierungen problemlos?
- Gibt es relevante Einschränkungen bei Attention-Backends, Context-Länge oder KV-Cache?
- Wie verhält sich die Karte bei längeren Inferenzläufen und wiederholten API-Anfragen?
- Gibt es Probleme mit Speicherlecks, Abstürzen oder Treiber-Resets?
- Wie hoch sind Leerlaufverbrauch und reale Leistungsaufnahme bei Inferenz?
- Wie groß ist der Einrichtungs- und Wartungsaufwand im Vergleich zu einer RTX 3090?
Hat jemand die B60 oder eine vergleichbare Intel-Arc-Pro-Karte bereits für lokale LLM-Inferenz im Einsatz? Besonders hilfreich wären konkrete Angaben zum verwendeten Modell, Backend, Betriebssystem, Treiberstand, Quantisierung und zur erreichten Geschwindigkeit.