Fireplace April 2026

Intel Arc Pro B60 als lokaler KI-Inferenzserver, Praxiserfahrungen unter Linux?

NimmEinenKeks

Newbie
Registriert
Juli 2026
Beiträge
3
Hallo zusammen,

ich beschäftige mich aktuell mit dem Aufbau eines lokalen KI-Servers für Inferenz und prüfe dabei unter anderem die Intel Arc Pro B60 mit 24 GB VRAM.

Der Einsatzzweck wäre ausdrücklich kein Gaming und zunächst auch kein Training größerer Modelle. Geplant ist ein möglichst stabiler, dauerhaft nutzbarer Inferenzserver für lokale Sprachmodelle, strukturierte JSON-Ausgaben und automatisierte Analyseaufgaben. Typische Modellgrößen wären etwa 20B bis 30B Parameter in geeigneter Quantisierung. Der Server soll später über eine lokale API angesprochen werden.

Bevor ich Hardware kaufe, teste ich den Anwendungsfall zunächst auf Cloud-GPUs mit 24 GB VRAM. Als lokale Lösung wäre die B60 wegen des Speicherausbaus und des voraussichtlich niedrigeren Preises gegenüber vielen Nvidia-Alternativen grundsätzlich interessant. Entscheidend ist für mich aber nicht die theoretische Rechenleistung, sondern ob der Software-Stack inzwischen zuverlässig genug für einen produktiven Dauerbetrieb ist.

Mich interessieren daher vor allem praktische Erfahrungen zu folgenden Punkten:
  • Wie stabil läuft die B60 aktuell unter Linux?
  • Welche Distribution und welche Treiberversionen funktionieren zuverlässig?
  • Wie gut ist die Unterstützung in llama.cpp, Ollama, vLLM oder vergleichbaren Inferenzlösungen?
  • Ist ein sauberer Betrieb über Docker möglich?
  • Funktionieren gängige GGUF-Quantisierungen problemlos?
  • Gibt es relevante Einschränkungen bei Attention-Backends, Context-Länge oder KV-Cache?
  • Wie verhält sich die Karte bei längeren Inferenzläufen und wiederholten API-Anfragen?
  • Gibt es Probleme mit Speicherlecks, Abstürzen oder Treiber-Resets?
  • Wie hoch sind Leerlaufverbrauch und reale Leistungsaufnahme bei Inferenz?
  • Wie groß ist der Einrichtungs- und Wartungsaufwand im Vergleich zu einer RTX 3090?
Mir ist bewusst, dass Nvidia bei KI-Anwendungen weiterhin den deutlich reiferen Software-Stack bietet. Die Frage ist für mich daher weniger, ob die B60 in einzelnen Benchmarks schneller oder langsamer ist, sondern ob sie inzwischen ohne ständige Sonderlösungen und manuelle Anpassungen als verlässlicher KI-Server betrieben werden kann.

Hat jemand die B60 oder eine vergleichbare Intel-Arc-Pro-Karte bereits für lokale LLM-Inferenz im Einsatz? Besonders hilfreich wären konkrete Angaben zum verwendeten Modell, Backend, Betriebssystem, Treiberstand, Quantisierung und zur erreichten Geschwindigkeit.
 
Du musst dich halt zur Nutzung von vLLM, ComfyUI, selbst bei den LLM Modellen auf Intels Software Stack verlassen. Das kann etwas dauern bis das neueste Model für Intels Pytorch Extension migriert wird, Huggingface ist da wahrscheinlich die beste Ressource und zeigt glaub ich das es schon recht aktuelle Modelle sind.


https://hub.docker.com/r/intel/vllm -> vLLM 0.21 vs vLLM 0.26

Distro in der Regel halt Ubuntu/Debian weils dafür die größte Nutzerbasis und die meiste Doku gibt. Es gibt keine fertige Distro wie zB Nvidias BaseOs. Mit ner KI auf der Seite bist damit genauso schnell am Ziel wie unter Cuda. Ans Ziel kommst dort wie da, wennst in Technikerstunden abrechnest machts wahrscheinlich mehr Sinn gleich zu Nvidia zu greifen.
 
Naja der Weg, über die gebrauchte/neu Radeon 7900xtx 24gb bleibt ja auch noch. Weil amd ihre Linux treiber sind um Welten da besser.zusätzlich ist die Karte billiger als Nvidia und Schneller als Intel,für deinen Einsatzzweck.
 
Warum kein AMD? ROCm ist inzwischen mächtig genug, im Zweifel greift man ohnehin auf Vulkan-Backend zurück.
Alternativ direkt einen Mini-PC, etwa von Framework oder Minisforum, welche interne PCIe-Schnittstellen haben und man etwa eine Controller-Karte installieren kann um das Ding entsprechend auch als Storage zu verwenden
 
LadykillerTHG schrieb:
Naja der Weg, über die gebrauchte/neu Radeon 7900xtx 24gb bleibt ja auch noch. Weil amd ihre Linux treiber sind um Welten da besser.zusätzlich ist die Karte billiger als Nvidia und Schneller als Intel,für deinen Einsatzzweck.
Die 7900xtx wäre ne Option gewesen wenn die nicht 1800€ kosten würde. Gebraucht wahrscheinlich noch immer deutlich über 1k ohne in die Recherche zu gehen :D Bei der B60 reden wir über vertretbare ~700€
 
nein du kriegst die 7900xtx um die 700€ ohne probleme gebraucht gekauft. DU solltest dich erst dazu auch infomieren weil sie auch schneller ist.
 
Zurück
Oben