News Imposter-Modelle: Chinesische KI-Modelle geben sich als Claude aus

mischaef

Kassettenkind
Teammitglied
Registriert
Aug. 2012
Beiträge
7.847
  • Gefällt mir
Reaktionen: schneeland und BrollyLSSJ
Kein Beweis für Destillation. Aber wenn Kimi schon Claude hieß, war der Spickzettel wohl ziemlich ausführlich.
 
  • Gefällt mir
Reaktionen: the_IT_Guy, Zagrthos, Bigfoot29 und 2 andere
Neulich fragte ich Claude Opus (weil er blöd wirkte) wie er heißt. Er sagte "Claude Opus". Ich fragte dann woher die Info ist. Er meinte aus dem Systemprompt, aber aus den Trainingsdaten wäre es "Claude von Anthropic". Also trainiert Anthropic den Modellen nicht die konkrete Modellbezeichnung ein. So lässt sich für gleiches Geld ein dümmeres Modell unterschieben ohne dass der Kunde etwas merkt.
 
  • Gefällt mir
Reaktionen: PaCuru
Interessant wie wichtig die "Identität" einer AI doch ist, wenn sie sich so deutlich anders verhält, wenn sie denkt sie wäre Claude. Ohne den Artikel oder die Infos zu kennen, wäre ich erst mal davon ausgegangen das ihr der eigene Name total egal sein sollte.

Anderseits heißt das doch, sie muss sie wissen, wie sich Claude verhält sonst könnte sie es ja nicht nachahmen. Ist damit nicht doch bewiesen das sie sich daran bedient haben oder woher kommt die ausführliche Kenntnis wie sich die andere AI denn verhalten sollte?
 
Destillation mag ich nur bei guten Bränden. :schluck:
 
  • Gefällt mir
Reaktionen: the_IT_Guy, Nerdpatrol, billgast und eine weitere Person
Meine Freunde dürfen mich Claude nennen.
 
  • Gefällt mir
Reaktionen: the_IT_Guy und stevefrogs
Das nennt man heute also "Studie"? Sag einem KI-Modell, es solle so tun, als sei es "jemand" anderes (mit anderen Worten: lügen) und wundere Dich dann, wenn es andere Dinge antwortet. Wow.

Besonders wissenschaftlich, wenn man nur Propaganda abklopft statt Fakten. Woher wollen die Autoren denn wissen, was über China wirklich wahr ist? Weil Trump es sagt? Diese Art von "Forschung" ist wie Selbstgespräche.
 
Okay, sie haben also exakt gar nichts rausgefunden, ausser dass man KIs überreden kann sich in Rollen einzufinden, was jetzt spektakuläre News sind - nicht. 🤣
 
  • Gefällt mir
Reaktionen: Nerdpatrol und Tsu
Wg. Kompatibilität? Mein Browser gibt auch vor, dass ich mit Windows unterwegs bin.

Schon ärgerlich, dass diese LLMs Black-Boxen sind bei denen man nicht nachvollziehen kann, was zur Antwort geführt hat.
 
@Tsu Bei einem Browser ist das aber eine bewusst gesetzte Kompatibilitätsangabe.
Wenn ein LLM ohne dass ihm vorher gesagt worden ist es sei ein Claude, dann ist eher die Frage woher es das weiß oder warum es das glaubt.
 
@br3adwhale Woher es das weiss ? Das stellt sich dir als Frage ? Von den Trainingsdaten wäre das VIELLEICHT eine Möglichkeit ? 🤣
 
Also Trainingsdaten = Claude-Destillation, sagst du?
 
  • Gefällt mir
Reaktionen: ThirdLife
Nerdpatrol schrieb:
Das nennt man heute also "Studie"? Sag einem KI-Modell, es solle so tun, als sei es "jemand" anderes (mit anderen Worten: lügen) und wundere Dich dann, wenn es andere Dinge antwortet. Wow.
Liegt daran, dass es ein hyped Thema ist und leicht aufmerksamkeit generiert.


br3adwhale schrieb:
Wenn ein LLM ohne dass ihm vorher gesagt worden ist es sei ein Claude, dann ist eher die Frage woher es das weiß oder warum es das glaubt.
Weil es häufig basierend auf deinem prompt die Antwort halluziniert die es für am wahrscheinlichsten hält - Antwort ist ungleich wissen. Das wird viel zu selten beachtet.

Ciero
 
  • Gefällt mir
Reaktionen: br3adwhale
Die westlichen Modelle wurden alle mit Daten trainiert, die den Unternehmen nicht gehört haben. Ist nur richtig, wenn sie Opfer der gleichen Strategie werden.
 
Wenn die Studie hier korrekt wiedergegeben wurde, dann ist sie absoluter Unsinn.

Die Modelle wissen reichlich wenig über sich selbst. Wenn sie es wissen, dann weil es im Basisprompt der Anwendung steht.
Also was genau haben die getestet?

In meinem Test hatte GLM 5.2 keine Ahnung wer er ist (und genau der wusste es angeblich immer).
Opus 5 weiß dass er Claude ist (aber nicht welches Modell)
Kimi K3 weiß dass es Kimi ist, aber auch nicht welches Modell
Deepseek V4 Flash hält sich für Sonnet 3.5

Und selbst bei den Infos wäre ich mir nicht sicher, ob die nicht doch irgendwie zugespielt werden.

Also was haben die getestet? Den Basisprompt der Anwendung?
 
br3adwhale schrieb:
Also Trainingsdaten = Claude-Destillation, sagst du?
Ja klar, unter anderem. Jeder schaut sich bei jedem was ab, destilliert was nur geht, klaut Bücher, Archive etc. pp.

Das muss einem klar sein bei dem was hier an Geld fliesst kann man sich schlicht nicht erlauben komplett ehrlich und transparent zu arbeiten. Das macht auch Anthropic nicht wie der letzte Litigation Case zeigt mit 1,5 Mrd an Zahlungen an Rechteinhaber.

Sollte nicht barsch rüberkommen, sorry dafür. :daumen:

PS: man weiss auch nicht wie System-Prompts, Harness etc. noch reinspielen. Es gibt viele Möglichkeiten wo etwas bei einem probabilistischen Modell wie LLMs ganz schnell komplett anderen Output erzeugen kann und Artefakte mitgibt (bewusst oder unbewusst).
 
@ThirdLife alles gut :) handfeste Beweise gibt es nicht aber dass die voneinander abschauen ist auf jeden Fall plausibel.
 
  • Gefällt mir
Reaktionen: ThirdLife
Zurück
Oben