Fireplace April 2026

News GPT-5.5 Instant: Neues ChatGPT-Modell halluziniert weniger

@Skidrow1988 Wir widersprechen der korrekten Antwort und dann fängt das Chaos an.
 
  • Gefällt mir
Reaktionen: Relict und Metalveteran
1778083549077.png


Die KI-Google-Suche.
Hat geklappt.
Ansonsten shit in, shit out.
 
gaym0r schrieb:
Warum weiß man 2026 immer noch nicht, dass LLMs keine Rechner oder Zähler sind?

Die sind auch sonst ganz vieles nicht:
 
  • Gefällt mir
Reaktionen: Muntermacher und K3ks
Mit Erdbeere das war im Voicemodus!
Nicht per Texteingabe.

Aber heute mit dem neuen Modell sind die Antworten leicht besser als gestern,
wobei gestern schlechter als sonst üblich war.
 
  • Gefällt mir
Reaktionen: Schubskarre
gaym0r schrieb:
Warum weiß man 2026 immer noch nicht, dass LLMs keine Rechner oder Zähler sind?
🥴 Ja ja ja. [[[Wenn der Wort-Verwurster einem als Alles-Tool und Reasoning ""Generator"" vermarktet wird und die Küche abbrennt weil ich meine Nudeln laut "AI"-Instruktionen 2 Stunden gekocht hab....]]]

Aber ernsthaft, Gemini vor einem halben Jahr:
K3ks schrieb:
AI Overview
Eine AMD Radeon RX 9060 XT ist mit PCIe 3.0 nicht kompatibel; sie unterstützt nur PCIe 5.0. PCIe ist zwar abwärtskompatibel, aber die 9060 XT ist für eine neuere Schnittstelle konzipiert und kann nicht mit der älteren PCIe 3.0-Technologie arbeiten.

Spezifikationen: Die RX 9060 XT ist für die Verwendung mit der neuen PCI Express Gen 5-Schnittstelle optimiert, um die volle Leistung zu ermöglichen.
Abwärtskompatibilität: PCIe 3.0 ist zwar theoretisch abwärtskompatibel mit PCIe 5.0-Steckplätzen, aber die umgekehrte Situation (eine PCIe 5.0-Karte in einem PCIe 3.0-Steckplatz) führt zu Kompatibilitätsproblemen, da die Karte nicht mit der älteren Schnittstelle arbeiten kann.
Jetzt 😎👍:
K3ks schrieb:
Gemini said

Yes, the AMD Radeon RX 9060 XT is fully compatible with PCIe 3.0.
While the card is designed with a modern PCIe 5.0 x16 interface, PCIe standards are backward compatible. You can plug it into a PCIe 3.0 slot on an older motherboard, and it will function without any issues.
->👍

Ich glaub selbst hab ich noch keine anderen AI-Dingerl probiert, aber mit gefällte das Gurgel-Dingerlings.
 
Skidrow1988 schrieb:
Keine Ahnung was ihr macht.
1778087685389.png

Aber eigentlich ist die Antwort 3 korrekt. Ich frage ja nach "e" und nicht nach "e & E"
 
Der sogenannte Erdbeer-Test ist als "Intelligenz"test völlig ungeeignet.
Weil der wird jetzt schon seit Monaten diskutiert und benutzt. Das heißt aber auch: Wenn der KI-Betreiber will, dann hat er sich darauf eingestellt und sein Modell genau mit der Frage ge-tuned.
Und selbst bei verwandten Fragen muss man davon ausgehen, das sich die Hersteller darauf eingestellt haben.

Intelligenztests machen nur Sinn, wenn es Fragestellungen/Aufgaben sind, die das LLM vorher noch nicht gesehen hat.
 
  • Gefällt mir
Reaktionen: GuckenWasGeht, testwurst200, schneeland und eine weitere Person
Und ich dachte immer es wären die KI User die halluzinieren ... :smokin:
 
Wenn man weiß, wie die Dinger funktionieren, kann man sie auch gut einsetzen. Oder gut den tokenizer exploiten und Späßchen treiben.
Der Erdbeerentest ist für ein LLM das, was für Menschen optische Täuschungen sind. Ich hoffe keiner behauptet hier, Menschen wären nicht in der Lage zu sehen, weil es optische Täuschungen gibt.
 
Vor allen Dingen sollte man wissen, dass LLMs ohne Reasoning (5.5 Instant, oder andere Konversationsmodelle mit geringer Latenz) massiv limitiert sind, man also davon nicht auf Limitierungen von LLMs im Allgemeinen schließen kann. Dass das hier im Thread höchstens indirekt gestreift wurde, ist für ein Tech-Forum schon ziemlich bedauerlich.
Ja, die Fails ohne Reasoning sind immer noch lächerlich. Kann man sich jetzt den ganzen Tag drüber echauffieren, oder die Limitierungen kennen und vermeiden...
 
  • Gefällt mir
Reaktionen: Schwachkopp und aLanaMiau
aufkrawall schrieb:
massiv limitiert sind, man also davon nicht auf Limitierungen von LLMs im Allgemeinen schließen kann
Naja. Größere Modelle und Reasoning schiebt die Grenze etwas nach außen. Das prinzipbedingte Problem bleibt ja trotzdem bestehen.

aufkrawall schrieb:
oder die Limitierungen kennen und vermeiden...
Völlig Vermeiden wird man sie nicht können. Es hilft vor allem Modelle richtig einzusetzen und nicht für Aufgaben, für die sie eigentlich nicht gedacht sind.
 
  • Gefällt mir
Reaktionen: Azdak, sioh und the_IT_Guy
Wie sieht der Vergleich zu Gemini aus?
 
andy_m4 schrieb:
Naja. Größere Modelle und Reasoning schiebt die Grenze etwas nach außen. Das prinzipbedingte Problem bleibt ja trotzdem bestehen.
Spielt halt eine immer geringere Rolle, wenn mit neuen Reasoning-Modellen die Grenze immer weiter nach außen verschoben wird.

andy_m4 schrieb:
Völlig Vermeiden wird man sie nicht können. Es hilft vor allem Modelle richtig einzusetzen und nicht für Aufgaben, für die sie eigentlich nicht gedacht sind.
Habe deshalb auch nicht "völlig vermeiden" geschrieben?
Mit ein paar Sicherheitsfragen und Überprüfungen durch mehr als ein einziges LLM ist man für viele Nutzungsfälle schon ziemlich gut dabei.
 
Künstliche Dummheit vs natürliche Dummheit Runde 5 oder wie?

Weis ja ned, aber wenn man sich in einem Thema wirklich auskennt und testet so ein "KI" System damit aus - der bereut es sein Leben lang, die 20$ für so einen Test rausgeworfen zu haben.

Und bis die ganzen "Mainstream DummChatbots" für was anderes taugen als eben "Dummchatbot" oder "Projektmanipulation nach erfolgreicher Projektausforschung und Weitergabe an Dummchatbotentwickler" werden auch so Sachen wie die "Erdbeere" immer lustiger, oberflächlicher - Hauptsache der Hype flaut nicht ab - am Ende muß doch eh nur sichergestellt sein, dass ein KI Sexbot seinem Nerdbesitzer nicht ungewollt den Schritt rausreißt weil es was missverstanden hat....und wenn Dauerstoned Kevin ohne "KI" nicht mal mehr 2+2 zusammenzählen kann, ist das fürs BIP auch nur vorteilhaft...
 
"Bei diesen Themen produziert GPT-5.5 Instant 52,5 Prozent weniger halluzinierte Behauptungen als GPT-5.3 Instant. Der Anteil an erfundenen Fakten sinkt also deutlich."

Immer wieder muss ich mir anhören, ich würde lediglich falsch promten o_O

Meiner Meinung nach sollte die KI generell keine erfundenen Fakten nennen dürfen!
Das ist doch ein klarer Programmierfehler.

Aufgrund vom berühmten Beispiel Erdbeere habe ich mal chat gpt mit einer 7 Segmentanzeige in die irre geführt.
Zuerst hat die KI eine ganz andere Zahl erkannt, dann wieder eine falsche und dann habe ich absichtlich auf eine falsche Zahl "korrigiert"

Oh ja du hast recht jetzt sehe ich das auch. So ein Ja sager...

Letztens meinte gpt auch, die CDU ist stand 2026 kein Teil der Bundesregierung.
Das deutet auf das schnelle Model hin jedoch habe ich explizit websearch verlangt. Zudem hat gpt mit der Zeitangabe versucht zu vertuschen, dass er da lediglich das schnelle Model benutzt hat. Es hat eine falsche Sicherheit erzeugt.

Nach mehreren Wochen nutzen vom thinking Model bin ich der Meinung, in den 1,2 Minuten holt sich Chat gpt lediglich einen Kaffee. Die Antworten sind nicht wirklich besser.
 
  • Gefällt mir
Reaktionen: the_IT_Guy
Tech-Dino schrieb:
Okay, gleich mal fragen, wie viele „E“s in dem Wort „Erdbeere“ enthalten sind.

Wenn man dann noch sagt: „Nein, da vertust Du Dich, es sind 5"
Mein Lehrer sagt 7 … Am Ende war GPT fest davon überzeugt, es seien natürlich 8 „E“s.

Gestern erst ausprobiert mit der Familie – war ein Lacher. :daumen:


EDIT: wichtig es war im Sprachmodus! Nicht per Texteingabe.

1778129469154.png


Meiner hat wohl nen guten Tag :D
Ist aber auch mit 5.5. Thinking auf "Länger" gestellt.
 
Schubskarre schrieb:
Oder hat dich nur getrollt.;)
Bin mit ChatGPT für meine Anwendungsbereichen nach wie vor zufrieden.
ABER trollen kann er gut.

Musst mal fragen für was das E in ChatGPT steht ;) :D
 
  • Gefällt mir
Reaktionen: Schubskarre
Es sagt schon vieles aus, wenn "weniger Halluzinationen" bei einem Computerprogramm als Fortschritt gilt 🤦.
 
  • Gefällt mir
Reaktionen: the_IT_Guy, Relict, testwurst200 und eine weitere Person
Zurück
Oben