Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
NewsNemotron 3.5 Lightning: Nvidia macht KI-Agenten schneller und günstiger
Nvidia erweitert seine multimodale, offene Nemotron-Modellfamilie um Nemotron 3.5 Lightning und stellt mit NeMo Switchyard eine Open-Source-Lösung für intelligentes Modell-Routing vor. Beide Technologien sollen agentische KI schneller, günstiger und flexibler machen – vom lokalen PC bis zum Rechenzentrum und in der Cloud.
Dieses Switch Modell habe ich bis heute nicht verstanden, wie kann ich ein dümmeres Modell haben wollen, wenn "Frontier" Modelle schon an der berühmten Erdbeere scheitern.
Okay, ernstgemeinte Frage weniger polemisch.
Dafür sank im Gegenzug die Genauigkeit um sechs Prozent.
Genau dafür sind die Switchmodelle da. Sie analysieren die Aufgabe und wählen auf Grund dessen das Model. Dadurch werden Prozesse in Summe schneller, die Kosten bzw. Tokenverbräuche gesenkt und das Ergebnis bleibt in der Regel trotzdem passend.
Du transportierst doch auch nicht mit einem LKW eine einzelne Schraube, nur weil es geht.
Oftmals kann man das Ergebnis gut verifizieren. Davon abgesehen ist KI so teuer, dass das keine Option ist die ganze Zeit intensiv mit den teuersten Modellen zu arbeiten.
Durch die geringe Anzahl an aktiven Parametern bei MoE Modellen sind diese halt wesentlich schneller als Dense-Modelle, da weniger Parameter pro Token und Layer verarbeitet und übertragen werden müssen (geringere Starvation bei Computing und Bandbreite).
Der Trick zum Erreichen der hohen Geschwindigkeit bzw. der höheren Geschwindigkeit im Vergleich zu den beiden genannten Modellen rührt wohl daher, dass das Nemotron-Modell mit integriertem MTP ausgestattet ist, während die Konkurrenzvarianten in der Grafik darauf verzichten müssen (auch wenn von ihnen modifizierte Varianten mit MTP existieren). Außerdem werden wohl auch zwei zusätzliche Token-Draft-Modelle (speculative decoder) veröffentlicht: DSpark und DFlash.
Ich habe persönlich die Erfahrung gemacht, dass MoE Modelle bei Multi-Turn Chats und großen Kontextfenstern bei weitem nicht so stabil sind wie im Vergleich kleinere Dense-Modelle, weshalb ich letztere trotz geringerer Geschwindigkeit immer noch bevorzuge (außer ich brauche eine schnelle One-Shot-Antwort). Zum Beispiel hat Gemma-4-12B (Dense) eine ähnliche, wenn auch leicht schlechtere Antwortqualität als Gemma-4-26B-A4B (MoE), aber dieses Verhältnis dreht sich sehr schnell um je länger der Chat läuft.