Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
NewsImposter-Modelle: Chinesische KI-Modelle geben sich als Claude aus
Eine Untersuchung zweier KI-Forscher zeigt, dass einige chinesische Sprachmodelle zeitweise behaupteten, Claude von Anthropic zu sein oder diese Identität auf Aufforderung übernahmen. Spekulationen über Trainingsmethoden wie Model Distillation gewinnen dadurch zwar an Fahrt, werden aber nicht belegt.
Hmm, ja, um eine eigene KI zu besitzen muss man eigentlich nur einer Vorhandenen beibringen die Frage nach ihrer Herkunft falsch zu beantworten, oder? ^^
Neulich fragte ich Claude Opus (weil er blöd wirkte) wie er heißt. Er sagte "Claude Opus". Ich fragte dann woher die Info ist. Er meinte aus dem Systemprompt, aber aus den Trainingsdaten wäre es "Claude von Anthropic". Also trainiert Anthropic den Modellen nicht die konkrete Modellbezeichnung ein. So lässt sich für gleiches Geld ein dümmeres Modell unterschieben ohne dass der Kunde etwas merkt.
Interessant wie wichtig die "Identität" einer AI doch ist, wenn sie sich so deutlich anders verhält, wenn sie denkt sie wäre Claude. Ohne den Artikel oder die Infos zu kennen, wäre ich erst mal davon ausgegangen das ihr der eigene Name total egal sein sollte.
Anderseits heißt das doch, sie muss sie wissen, wie sich Claude verhält sonst könnte sie es ja nicht nachahmen. Ist damit nicht doch bewiesen das sie sich daran bedient haben oder woher kommt die ausführliche Kenntnis wie sich die andere AI denn verhalten sollte?
Ist doch nichts neues? Habe schon letztes Jahr zu GLM 4.5-Air Zeiten (genauer genommen die lokale Heretic Variante im LM Studio) das Modell gefragt was es eigentlich ist. Da meinte es, es sei Claude von Anthropic.
Das nennt man heute also "Studie"? Sag einem KI-Modell, es solle so tun, als sei es "jemand" anderes (mit anderen Worten: lügen) und wundere Dich dann, wenn es andere Dinge antwortet. Wow.
Besonders wissenschaftlich, wenn man nur Propaganda abklopft statt Fakten. Woher wollen die Autoren denn wissen, was über China wirklich wahr ist? Weil Trump es sagt? Diese Art von "Forschung" ist wie Selbstgespräche.
Okay, sie haben also exakt gar nichts rausgefunden, ausser dass man KIs überreden kann sich in Rollen einzufinden, was jetzt spektakuläre News sind - nicht. 🤣
@Tsu Bei einem Browser ist das aber eine bewusst gesetzte Kompatibilitätsangabe.
Wenn ein LLM ohne dass ihm vorher gesagt worden ist es sei ein Claude, dann ist eher die Frage woher es das weiß oder warum es das glaubt.
Das nennt man heute also "Studie"? Sag einem KI-Modell, es solle so tun, als sei es "jemand" anderes (mit anderen Worten: lügen) und wundere Dich dann, wenn es andere Dinge antwortet. Wow.
Weil es häufig basierend auf deinem prompt die Antwort halluziniert die es für am wahrscheinlichsten hält - Antwort ist ungleich wissen. Das wird viel zu selten beachtet.
Die westlichen Modelle wurden alle mit Daten trainiert, die den Unternehmen nicht gehört haben. Ist nur richtig, wenn sie Opfer der gleichen Strategie werden.
Wenn die Studie hier korrekt wiedergegeben wurde, dann ist sie absoluter Unsinn.
Die Modelle wissen reichlich wenig über sich selbst. Wenn sie es wissen, dann weil es im Basisprompt der Anwendung steht.
Also was genau haben die getestet?
In meinem Test hatte GLM 5.2 keine Ahnung wer er ist (und genau der wusste es angeblich immer).
Opus 5 weiß dass er Claude ist (aber nicht welches Modell)
Kimi K3 weiß dass es Kimi ist, aber auch nicht welches Modell
Deepseek V4 Flash hält sich für Sonnet 3.5
Und selbst bei den Infos wäre ich mir nicht sicher, ob die nicht doch irgendwie zugespielt werden.
Also was haben die getestet? Den Basisprompt der Anwendung?
Ja klar, unter anderem. Jeder schaut sich bei jedem was ab, destilliert was nur geht, klaut Bücher, Archive etc. pp.
Das muss einem klar sein bei dem was hier an Geld fliesst kann man sich schlicht nicht erlauben komplett ehrlich und transparent zu arbeiten. Das macht auch Anthropic nicht wie der letzte Litigation Case zeigt mit 1,5 Mrd an Zahlungen an Rechteinhaber.
Sollte nicht barsch rüberkommen, sorry dafür.
PS: man weiss auch nicht wie System-Prompts, Harness etc. noch reinspielen. Es gibt viele Möglichkeiten wo etwas bei einem probabilistischen Modell wie LLMs ganz schnell komplett anderen Output erzeugen kann und Artefakte mitgibt (bewusst oder unbewusst).