Alternate 2

News Google mit zwei „P“: Wie der AI Overview beim Buchstabieren scheitert

interesTED schrieb:
Ich finde auch kein KI Modell, das etwas anderes behauptet.
Wie grad gesagt: die alle sind nicht deterministisch, du bekommst nicht die selben ergebnisse. (Außer es wird gecachet).
Probiers mal aus, setze den selben Prompt mal so 5-10x im selben LLM. Immer in neuen chats, damit kein Kontext mitgenommen wird.
Bei mir hat Chatgpt nachm 5. Versuch dann doch ein p gesehen.
 
  • Gefällt mir
Reaktionen: Kitsune-Senpai und AlphaKaninchen
Mordi schrieb:
Probiers mal aus, setze den selben Prompt mal so 5-10x im selben LLM. Immer in neuen chats, damit kein Kontext mitgenommen wird.
Ich habe das grade mit sonnet gemacht, konsequent behauptet 2 p nur um sich dann zu korrigieren, also z. B.
https://claude.ai/share/bcb46c63-0a25-41ea-b582-45095a9fc1f7
Es gibt 2 p's in „google" — nein, warte:

g - o - o - g - l - e

Tatsächlich gibt es kein einziges „p" in „google". 😊
 
  • Gefällt mir
Reaktionen: Kitsune-Senpai und WauWauWau
  • Gefällt mir
Reaktionen: Kitsune-Senpai und ReignInBlo0d
interesTED schrieb:
Ich finde auch kein KI Modell, das etwas anderes behauptet.
Ich finde sonnet 4.6 low faszinierend, es macht den Fehler oder eben nicht Buchstabiert das Wort und korrigiert sich selbst, interessant finde ich das manchmal schon vor dem buchstabieren nein warte kommt, bei Sachen die vorher schon richtig waren kommt zwar das buchstabieren aber kein nein warte davor, könnte mir aber vorstellen das es bei den Klassikern explizit zu trainiert ist.
 
gimmix schrieb:
"Le Chat" ist auch nicht besser:
Ist aber witzig wie das immer Zustande kommt. Da scheint es ein Problem mit der Abgrenzung zwischen dem gesamten Prompt und dem gefragten Wort zu geben, denn der Prompt insgesamt enthält tatsächlich zwei "l" :D
 
  • Gefällt mir
Reaktionen: interesTED
@FrozenPie Gut beobachtet. Man sieht an der Einstellung aber auch, dass Thinking aus ist. Nicht der beste Garant um so eine Aufgabe abzuschließen. Wenn ich mir angucke, wie viele Tokens Claude tlw an thinking erzeugt …
 
interesTED schrieb:
Man sieht an der Einstellung aber auch, dass Thinking aus ist. Nicht der beste Garant um so eine Aufgabe abzuschließen.
Ja, die Mistral Modelle sind mit abgeschaltetem Thinking ziemlich unpräzise. Mit eingeschaltetem Thinking sind sie allerdings ziemlich gut und gar nicht so weit abgeschlagen nach meiner Erfahrung. Finde "Thinking" aber immer noch die falsche Bezeichnung, weil das "Thinking" eigentlich nur die Fragestellung für das Modell einfacher interpretierbar umformuliert und Lücken mit Annahmen schließt, sodass die Antwort auf Basis eines größeren Input-Prompts verfasst werden kann, was sowieso schon immer bessere Ergebnisse geliefert hat.
 
  • Gefällt mir
Reaktionen: interesTED
Es ist so witzlos, bedenke man die Gelder die da rein gesteckt werden würden ins Globale Bildungssystem gesteckt.
Ist doch kla das die AI immer besser wird mit der Zeit, aber nur weil sie ständig Vorrang hat.
Alle sagen guck mal wie gut das alles ist, ja aber nur weil keiner eine Grenze aufgezeigt bekommt. Die Schuldenberge wachsen weiter.

Gut das die Firmen so langsam merken wie teuer der Spaß wird machen die Preise zum ersten Mal erhöht wurden und zurückrudern.
 
Na zumindest das Problem mit der Satire haben sie ja nun gelöst...

f2e-4259261318.jpg
 
  • Gefällt mir
Reaktionen: Tevur, AlphaKaninchen, MaverickM und eine weitere Person
Fragt die Lehrerin Hänschen eine Frage…meint der..Wollen Sie die Antwort mit Thinking oder ohne?
…oder so in der Art
 
  • Gefällt mir
Reaktionen: Kitsune-Senpai
Oumi nutzte den branchenbekannten Benchmark SimpleQA, um die Qualität der KI-Suche anhand 4.326 Anfragen zu testen. Das Ergebnis: Mit dem älteren Modell Gemini 2 wurden 85 Prozent der Anfragen korrekt beantwortet, bei Gemini 3 (seit November 2025 verfügbar) waren es bereits 91 Prozent.

Ja, die Aussagekraft eines branchenbekannten synthetischen Benchmarks ist absolut hoch! Mindestens 0!

Zu mehr als grober Textverarbeitung taugen die LLMs quasi alle nicht. Beim Rest schleichen immer viel zu viele Fehler ein.


Vibe/Le Chat macht das aber etwas besser: :D

1780014720716.png


gimmix schrieb:
"Le Chat" ist auch nicht besser:

Hmmm:

1780014968805.png


Scheint von der Art der Frage abzuhängen.
 
Zuletzt bearbeitet:
Google startet die nächste Ausbaustufe der KI-Suchmaschine...
Der Artikel startet mit etwas was er gar nicht beantwortet. Ja was ist denn die nächste Ausbaustufe?
 
  • Gefällt mir
Reaktionen: ascer
Mordi schrieb:
Das Grundproblem ist, dass die Antworten von LLMs nicht deterministisch sind.
Sind sie, aber das ist nicht gewollt. Daher bekommt man im Browser bei der selben Frage oft leicht andere Antworten.

Wenn du aber z.B. ChatGPT per API nutzt kannst du "temperature" mit 0 übergeben. Dann bekommst du mit der selben Frage immer die selbe Antwort.
 
Wenn das ein "branchenbekannten Benchmark" ist, dann ist anzunehmen, dass ähnlich wie beim Erdbeertest die Hersteller auf die Fragen dieses Benchmarks hin optimieren. Und dann sind um 90% katastrophal schlecht.

Wahrscheinlich ist in Wahrheit der Anteil falscher Antworten wie bei bisherigen Modellen 25-33%. Yeah, KI :D
 
Google's KI-Suche scheitert bei so einigem - bei Diablo IV gibts ein Siegel namens "Armageddon Way":

ArmaWay.png


Google's KI kennt das Siegel nicht mal und serviert stattdessen 1.000.000 Ergebnisse zum "Aspect of Armageddon" - einem Aspekt der gerne von Zauberern verwendet wird und der mit dem Siegel überhaupt nichts zu tun hat - soviel zum Thema "Gezielte Infos durch Google KI" *seufz. :rolleyes:
 
Nun, Menschen lesen Wörter auch nicht Buchstabe für Buchstabe. Es ist völlig ausreichend ein Wort ungefähr zu schreiben bzw. nur den anfangs und Endebuchstaben richtig zu setzen, der Rest muss nur ungefähr stimmen.
Wieso sollte eine KI das anders machen?
Buchstaben einzeln wahrnehmen tun wir auch erst dann wenn es tatsächlich erforderlich ist, zB. beim Buchstabieren. Damit wir das können mussten wir erst mal paar Jahre die Schulbank drücken.

Damit will ich die KI nicht in Schutz nehmen das ganze aber etwas relativieren. In der Verantwortung sind die betreiber der KI Modelle die sowas ohne jeglichen Hinweis auf die Öffentlichkeit loslassen.

KI ist nicht intelligent. Es gibt sogar Menschen auf die diese Aussage zutrifft, sonst gäbe es diese ganze Diskussion ja nicht.
 
  • Gefällt mir
Reaktionen: AlphaKaninchen und BloodyEyeX
Die kI kann keine Buchstaben zählen?
Schock schwere not.
Ich schreibe Mal ne böse mail an knipex dass sich deren Zangen nur sehr eingeschränkt zum einschlagen von Nägeln eignen und sägende arbeiten quasi unmöglich sind.
 
  • Gefällt mir
Reaktionen: ascer, Tevur und AlphaKaninchen
Für uns sieht die Aufgabe sehr einfach aus, für die KI aber nicht.
Das ist für uns Menschen wie die Frage: "Wieviele horizontale Striche beeinhaltet das Wort: Enterprise"
Die Antwort schüttelt man nicht ebend aus dem Ärmel und es kommt uns sinnlos vor dannach zu fragen.
 
  • Gefällt mir
Reaktionen: AlphaKaninchen und qualle
Für die KI ist die Aufgabe auch sehr einfach, wenn der Thinking Modus an ist. Exakt wie @Tulol schreibt. Wenn ich euch mündlich anspreche und frage, wie viele Buchstaben in einem längeren Wort sind, könnt ihr das auch nicht aus dem Stehgreif beantworten, sondern müsst was...? Nachdenken und zählen. Wenn man das nicht tut, oh schreck, dann rät man. Die KI ahmt hier den menschlichen Gedankenprozess nach und wenn du nicht zufälligerweise auswendig gelernt hast, wie viele Buchstaben in einem bestimmten Wort stehen, dann weißt du es auch nicht. Das ist hier kein KI-exklusives Problem, sondern es geht darum, welches Wissen man plausibler Weise auswendig verfügbar hat. Das ist maximal ein Google Problem, weil Google nicht die Rechenkapazität zur Verfügung hat, um auf jede Suchanfrage mit einer "Thinking" Antwort zu reagieren (aber wie hier schon gezeigt, können sogar Modelle ohne Thinking die Aufgabe lösen). Und wenn ich bisher dem Internet geglaubt oder nicht geglaubt habe, dann versuche ich von Google erhaltene Antworten natürlich auch zu verifizieren. Mal davon abgesehen, dass das hier eine vollkommen artifizielle Frage ist.
 
  • Gefällt mir
Reaktionen: qualle
Ja, eben. Für einen Computer ist so eine Aufgabe auch nur "leicht", wenn spezielle (zielgenaue) Algorithmen zum Einsatz kommen. Wenn "der Computer" (also die KI) aber denkt wie ein Mensch, werden auch die gleichen Schwächen offenbar.

Ein ähnliches Aufgabenkaliber wäre hier, eine längere Liste alphabetisch zu sortieren oder sie in zufällige Reihenfolge zu bringen.

Aber diese "Einschränkungen" sind ja nicht neu, und wären wahrscheinlich auch erst mit der nächsten KI-Entwicklungsstufe "weg" - also dann, wenn die KI nicht mehr ("so ähnlich") wie ein Mensch denken würde.
 
Zurück
Oben