News Nemotron 3.5 Lightning: Nvidia macht KI-Agenten schneller und günstiger

nlr

Redakteur
Teammitglied
Registriert
Sep. 2005
Beiträge
11.524
  • Gefällt mir
Reaktionen: BeBur
Dieses Switch Modell habe ich bis heute nicht verstanden, wie kann ich ein dümmeres Modell haben wollen, wenn "Frontier" Modelle schon an der berühmten Erdbeere scheitern.

Okay, ernstgemeinte Frage weniger polemisch.

Dafür sank im Gegenzug die Genauigkeit um sechs Prozent.
Woher weiß ich, dass ich nicht genau diese 6 Prozent Genauigkeit gebraucht hätte?
 
  • Gefällt mir
Reaktionen: flo.murr
Genau dafür sind die Switchmodelle da. Sie analysieren die Aufgabe und wählen auf Grund dessen das Model. Dadurch werden Prozesse in Summe schneller, die Kosten bzw. Tokenverbräuche gesenkt und das Ergebnis bleibt in der Regel trotzdem passend.
Du transportierst doch auch nicht mit einem LKW eine einzelne Schraube, nur weil es geht.
 
  • Gefällt mir
Reaktionen: M-X, Col.Maybourne, Grundkurs und eine weitere Person
the_IT_Guy schrieb:
wie kann ich ein dümmeres Modell haben wollen, wenn "Frontier" Modelle schon an der berühmten Erdbeere scheitern.
Wann hast du zuletzt mit KI gearbeitet? Die neueren Modelle sind ziemlich gut.

the_IT_Guy schrieb:
Woher weiß ich, dass ich nicht genau diese 6 Prozent Genauigkeit gebraucht hätte?
Oftmals kann man das Ergebnis gut verifizieren. Davon abgesehen ist KI so teuer, dass das keine Option ist die ganze Zeit intensiv mit den teuersten Modellen zu arbeiten.
 
  • Gefällt mir
Reaktionen: M-X, Col.Maybourne, waldgeist2k und 2 andere
Nvidia Grafiken!
article-1280x720.b7af1275.jpg
 
  • Gefällt mir
Reaktionen: wesch2000, Col.Maybourne, ElisaMüller und 2 andere
the_IT_Guy schrieb:
Woher weiß ich, dass ich nicht genau diese 6 Prozent Genauigkeit gebraucht hätte?
Weißt du bei deinem Junior-Kollege auch nicht.
 
  • Gefällt mir
Reaktionen: M-X, BeBur, the_IT_Guy und eine weitere Person
Haldi schrieb:
Ich mag die Bezeichnung "Less Smart" anstelle von "Stupid" :D

@nlr
Bei MoE Modellen ist es noch sehr hilfreich/wichtig die Anzahl der aktivierten Parameter zu wissen:
  • Gemma-4-26B-A4B (26 Mrd. Parameter insgesamt, 4 Mrd. aktiv)
  • Qwen3.6-35B-A3B (35 Mrd. Parameter insgesamt, 3 Mrd. aktiv)
  • Nemotron-3.5-Lightning-30B-A3B (30 Mrd. Parameter insgesamt, 3 Mrd. aktiv)
Durch die geringe Anzahl an aktiven Parametern bei MoE Modellen sind diese halt wesentlich schneller als Dense-Modelle, da weniger Parameter pro Token und Layer verarbeitet und übertragen werden müssen (geringere Starvation bei Computing und Bandbreite).

Der Trick zum Erreichen der hohen Geschwindigkeit bzw. der höheren Geschwindigkeit im Vergleich zu den beiden genannten Modellen rührt wohl daher, dass das Nemotron-Modell mit integriertem MTP ausgestattet ist, während die Konkurrenzvarianten in der Grafik darauf verzichten müssen (auch wenn von ihnen modifizierte Varianten mit MTP existieren). Außerdem werden wohl auch zwei zusätzliche Token-Draft-Modelle (speculative decoder) veröffentlicht: DSpark und DFlash.

Ich habe persönlich die Erfahrung gemacht, dass MoE Modelle bei Multi-Turn Chats und großen Kontextfenstern bei weitem nicht so stabil sind wie im Vergleich kleinere Dense-Modelle, weshalb ich letztere trotz geringerer Geschwindigkeit immer noch bevorzuge (außer ich brauche eine schnelle One-Shot-Antwort). Zum Beispiel hat Gemma-4-12B (Dense) eine ähnliche, wenn auch leicht schlechtere Antwortqualität als Gemma-4-26B-A4B (MoE), aber dieses Verhältnis dreht sich sehr schnell um je länger der Chat läuft.
 
Zuletzt bearbeitet:
Zurück
Oben