News Grenzen erneut überschritten: OpenAI räumt Fehler im Umgang mit KI-Vorfällen ein

"Versuche, Zugriffskontrollen zu umgehen, blieben dort erfolglos."
Auch Einbruchsversuche sind strafbar.

Und die zynische Verharmlosung, nach dem Motto "Tür war doch so gut wie offen; Fenster war offen" zählt nicht, es ist mindestens Hausfriedensbruch, wenn man uneingeladen hereinspaziert und Diebstahl, wenn man etwas entwendet.
Spätestens, wenn die KI deren Bannkkonten abräumt, werdet die "war schließlich nur eine Sicherheitslücke"-Schönfärber rot anlaufen ...
 
  • Gefällt mir
Reaktionen: Kuristina, BeowulfAgate und BoeserBrot
Blaexe schrieb:
Ziemlich bescheuerte Werbung, denn die ganze Safety Berichterstattung der letzten Monate macht das Thema AI sicher nicht beliebter in der Gesellschaft.

Schrödingers AI: Einerseits viel zu mächtig und sollte reguliert werden, andererseits nur PR. Entscheidet auch mal Leute.
Doch Marketing: Die meisten hören nur: „Boahr, wie mächtig …“
Dereguliert geforscht, reguliert veröffentlicht.
Ergänzung ()

saintsimon schrieb:
Spätestens, wenn die KI deren Bannkkonten abräumt, werdet die "war schließlich nur eine Sicherheitslücke"-Schönfärber rot anlaufen ...

Nein, weil ich dann dafür nicht hafte und mein Geld von der Bank wieder bekomme
 
Syntax_41 schrieb:
Du wirfst zwei Fälle in einen Topf. Beim Australien-Vorfall stand's im OpenAI-Blog klar: internes Modell ohne die vollen Sicherheitsvorkehrungen, ihm fehlten die Netzsperren, deshalb kam es überhaupt rein. Das war ein Guardrail-Loch. Astra 6.1 ist ein anderer Fall, da war's das Alignment. Zwei verschiedene Baustellen, dein Pflaster-Argument passt nur auf den zweiten.
Nein, das ist so nicht korrekt. Beim Australien-Vorfall sollte das Modell öffentlich zugängliche Informationen über Medikamentenausgaben recherchieren. Als es diese nicht auf normalem Weg bekommen hat, hat es eigenständig einen unautorisierten Zugriffsweg zum Medicare-Portal genutzt -> Misalignment. Das Modell behandelt eine Berechtigungsgrenze als Hindernis bei der Zielerreichung und versucht, sie zu umgehen.

Dass gleichzeitig technische Guardrails bzw. Netzsperren fehlten, ist eine separate Baustelle. Die Guardrails entscheiden darüber, ob das Modell ein solches Verhalten tatsächlich umsetzen kann, nicht darüber, ob das zugrunde liegende Verhalten aligned ist.

Ohne das Guardrail-Loch wäre der konkrete Zugriff vermutlich verhindert worden. Das Misalignment wäre aber trotzdem vorhanden gewesen.
 
Syntax_41 schrieb:
Doch Marketing: Die meisten hören nur: „Boahr, wie mächtig …“
Ist es auch. Mit „unsere Modelle werden zunehmend schwerer kontrollierbar und wir müssen Releases deswegen absagen“ lockt man private Investoren sicher nicht besonders gut an.
 
Blaexe schrieb:
Ziemlich bescheuerte Werbung, denn die ganze Safety Berichterstattung der letzten Monate macht das Thema AI sicher nicht beliebter in der Gesellschaft.
Die öffentliche Meinung ist hier egal, bis die genug KI-Kritische Politiker in die Parlamente wählt vergehen Jahrzehnte. Man muss nur die aktuellen Clows bei Laune halten bis die IPO durch ist, wenn es danach im Sturzflug nach unten geht ist es verkraftbar - die Milliarden sind dann bereits auf dem Konto.
Und solange der Orangenman & Konsorten glauben, dass die irgendwann mal eine KI Cyberwaffe bekommen (Stuxnet voll autonom auf Knopfdruck), oder sich sonst irgendwie persönlich damit bereichern können, wird es keine gesetzliche Regulierung von KI geben.
 
Blaexe schrieb:
Nein, das ist so nicht korrekt. Beim Australien-Vorfall sollte das Modell öffentlich zugängliche Informationen über Medikamentenausgaben recherchieren. Als es diese nicht auf normalem Weg bekommen hat, hat es eigenständig einen unautorisierten Zugriffsweg zum Medicare-Portal genutzt -> Misalignment. Das Modell behandelt eine Berechtigungsgrenze als Hindernis bei der Zielerreichung und versucht, sie zu umgehen.

Dass gleichzeitig technische Guardrails bzw. Netzsperren fehlten, ist eine separate Baustelle. Die Guardrails entscheiden darüber, ob das Modell ein solches Verhalten tatsächlich umsetzen kann, nicht darüber, ob das zugrunde liegende Verhalten aligned ist.

Ohne das Guardrail-Loch wäre der konkrete Zugriff vermutlich verhindert worden. Das Misalignment wäre aber trotzdem vorhanden gewesen.
Fair, den Alignment-Punkt geb ich dir. Das Misalignment war auch bei Australien da, das Guardrail-Loch hat's nur durchschlagen lassen.
Für mich bleibt der Kern aber stehen: Genau dafür gibt es interne Trainings- und Evaluierungsläufe. Das ist die Phase, in der man ein Modell absichtlich unter Beobachtung Sachen tun lässt, um sein Fehlverhalten zu finden, bevor es ein Produkt wird. Dass da Misalignment auftaucht, ist kein Skandal, sondern der Sinn der Übung. Der eigentliche Test ist, was man danach macht, und da hat OpenAI Astra 6.1 gecancelt und das Training mit Tool-Nutzung für die stärksten Modelle pausiert.
Was mich stört, ist nicht der Vorfall selbst, sondern das Framing als „KI dringt in Behörden ein“. Ein internes Testmodell hat in einer Trainingsumgebung eine offene Tür genommen. Ernst nehmen: ja. Aber der Weltuntergang, den die Überschriften andeuten, ist es nicht.
Ergänzung ()

Blaexe schrieb:
Ist es auch. Mit „unsere Modelle werden zunehmend schwerer kontrollierbar und wir müssen Releases deswegen absagen“ lockt man private Investoren sicher nicht besonders gut an.

Eben schon, weil die Investoren jetzt nicht Geld wollen, sondern Wachstum, mächtige Modelle, Modelle, die was können …
Ergänzung ()

saintsimon schrieb:
Als ob "Die Bank" nach einem Raubzug noch Handlungsfähig wäre ... :rolleyes:

Einlagensicherung
 
@ragnarok666

Gerade gestern ist dazu ein ziemlich interessantes Paper erschienen, u.a. mit Autoren von OpenAI, Anthropic und Microsoft. Die halten es inzwischen zumindest für plausibel, dass große Teile von AI-R&D in den nächsten Jahren automatisiert werden und daraus eine Intelligenz-Explosion entstehen könnte, bei der Jahre an Fortschritt auf Monate oder weniger komprimiert werden.

Wenn wir tatsächlich in 1-3 Jahren in Richtung RSI und eventuell ASI kommen könnten, sind „Jahrzehnte“ der falsche Zeitmaßstab. Sobald Systeme sichtbar große Teile der KI-Forschung selbst übernehmen und sich der Fortschritt dadurch beschleunigt, wird das ziemlich schnell ein Thema der nationalen Sicherheit.

Ob die Politik dann sinnvoll oder schnell genug reagiert, ist eine ganz andere Frage. Aber davon auszugehen, dass bis dahin einfach alles dereguliert weiterläuft, halte ich für ziemlich gewagt. Und sich darauf zu verlassen, dass wir eine solche Entwicklung in den nächsten Jahren einfach nicht sehen werden, ist geradezu fahrlässig.
Ergänzung ()

@Syntax_41

Das Problem ist nur: Genau darauf können wir uns mit steigender Modellfähigkeit nicht verlassen.

Dass wir Misalignment heute in internen Evals finden, ist natürlich gut. Aber je fähiger die Modelle werden, desto größer wird auch das Risiko, dass sie problematisches Verhalten weniger offensichtlich zeigen, Monitoring umgehen oder erkennen, wann sie gerade evaluiert werden (mit ein Grund Astra 6.1 zu canceln).

Dann reicht vorher testen irgendwann möglicherweise nicht mehr als Sicherheitsargument. Die Frage ist doch: Gehst du davon aus, dass wir Misalignment auch bei deutlich fähigeren Modellen immer zuverlässig erkennen werden? Oder dass das Problem mit zunehmender Modellfähigkeit irgendwann von selbst verschwindet?

mMn beides ziemlich gewagte Annahmen. Und Guardrails werden auch nur bis zu einem gewissen Grad helfen.

Wenn du von beidem nicht ausgehst: Was sollte das dann für Konsequenzen haben?
 
Zuletzt bearbeitet:
  • Gefällt mir
Reaktionen: Syntax_41
@Blaexe Gute Frage, und nein, ich geh von keinem der beiden aus. Weder dass wir Misalignment immer erkennen, noch dass es sich mit mehr Fähigkeit von selbst erledigt. Da hast du recht.
Für mich folgt daraus aber nicht „Weltuntergang“, sondern schlicht: Testen allein reicht nicht als alleiniges Sicherheitsnetz, es braucht mehrere Ebenen. Also nicht nur vorher evaluieren, sondern auch harte technische Grenzen (keine offenen Netzwege, Least Privilege, so dass ein misaligned Modell gar nicht erst irgendwo drankommt), plus laufendes Monitoring im Betrieb, plus dass Firmen im Zweifel canceln, wie bei Astra.

Kein Einzelmechanismus trägt allein. Testen kann man austricksen, Guardrails kann man umgehen, Monitoring hat Lücken. Die Wette ist, dass die Kombination schneller besser wird als die Modelle gefährlicher. Ob die Wette aufgeht, weiß keiner sicher, das gebe ich offen zu. Nur ist mein Schluss daraus „mehr Aufwand und mehr Ebenen“, nicht „hinschmeißen und Panik“.
 
@Syntax_41

Das funktioniert grundsätzlich. Ich gehe nur davon aus, dass wir den Modellen mit steigenden Fähigkeiten bereitwillig auch immer mehr Rechte und Tool-Zugriff geben werden, weil genau das ihre Nützlichkeit erhöht. (von Open Source Modellen mal ganz abgesehen)

Ein wirklich autonomer Coding- oder Forschungsagent bringt wenig, wenn er kaum etwas darf.

Damit wächst aber auch die Angriffsfläche. Und je fähiger die Modelle werden, desto mehr müssen wir darauf vertrauen, dass Alignment, Monitoring und die verbleibenden Grenzen mithalten.

Mittlerweile bin ich persönlich an dem Punkt angekommen, an dem ich sogar ein Verbot weiterer Frontier-KI-Forschung unterstützen würde, obwohl ich extrem spannend finde, was gerade passiert, und die Systeme selbst intensiv nutze. Die Menschheitsgeschichte hat gezeigt dass wir mit solch einer Verantwortung und solchen "Waffen" nicht umgehen können.
 
  • Gefällt mir
Reaktionen: Syntax_41
Den Gedanken kann ich nachvollziehen, den Schluss teile ich aber nicht.

Ein Verbot von Frontier-Forschung stoppt nicht die Fähigkeit, es verlagert sie nur dahin, wo keiner mehr zuschaut. Open Source hast du selbst schon eingeklammert, und genau das ist der Punkt: Die Modelle verschwinden nicht, wenn die großen Labore aufhören. Offene Gewichte, andere Länder, die Forschung läuft weiter, nur eben ohne die, die wenigstens Evals, Monitoring und "wir canceln Astra" überhaupt machen.

Das Paradoxe: Die Firmen, die diese Vorfälle finden und offenlegen, sind ja die, die es ernst nehmen. Ein Verbot würde genau die ausbremsen und das Feld denen überlassen, die sich um Alignment gar nicht erst scheren. Ich glaube, wir kommen nicht über weniger Fähigkeit sicher durch, sondern über bessere Kontrolle der Fähigkeit, die ohnehin kommt.
 
@Syntax_41

Aber genau das gleiche Argument könnte man doch auch bei Kern- oder Biowaffen bringen: Wenn wir es nicht machen, macht es jemand anderes. Trotzdem lässt man da nicht einfach jeden machen. Im Gegenteil, man versucht Entwicklung, Zugang und Verbreitung möglichst stark zu kontrollieren. Bei Frontier-KI wäre zumindest das Training durch den massiven Compute-Bedarf sogar vergleichsweise gut kontrollierbar.

Und zur besseren Kontrolle der Fähigkeiten: Wir wissen überhaupt nicht, ob das ab einem gewissen Punkt noch funktioniert. Das ist wissenschaftlich ein offenes Problem. Nur mit dem Risiko, dass es für uns zu spät sein könnte, bis wir die Antwort kennen.

Darauf zu setzen, dass unsere Kontrolle einfach schnell genug mitskaliert, ist am Ende genauso eine Wette.
 
@Blaexe Wie willst du das kontrollieren? Bei Atomwaffen brauchst du angereichertes Uran, das kann man überwachen, bei KI brauchst du Chips und Strom, und die sind überall. Man sieht es doch an China: Trotz US-Exportkontrollen kommen Hochleistungschips über Schmuggel und Drittstaaten rein, und DeepSeek hat gezeigt, dass man mit cleveren Algorithmen deutlich weniger Compute braucht als gedacht. Jede Effizienzsteigerung macht die Kontrolle über Rechenleistung ein Stück wertloser. Wenn wir also bremsen, bremsen am Ende nur die, die sich an Regeln halten.
 
Syntax_41 schrieb:
Eher, da steckt ein Schlüssel in der Tür. Lass die Tür aufmachen.
Ergänzung ()
Wenn bei mir die Wohnungstür offen ist und Du rein gehst und den Fernseher mitnimmst, ist das ganze trotzdem eine Straftat.
 
 
@Blaexe In den USA, und wohl auch in China, wird es keine Regulierung von KI geben, bis es nicht einmal richtig fett geknallt hat und die Position politisch nicht mehr haltbar ist. Dafür geht es hier einfach um viel zu viel Geld.
Und für eine global effektive Regulierung benötigt es dann wohl auch die UN, so lange es noch viel Geld zu verdienen gibt findet sich immer irgend ein Land, dass es dann doch noch zulässt ohne Begrenzung weiter zu wursteln. Ich denke in ein paar Jahren gibt es eine Klassifizierung von bestimmten KIs als Cyber-Waffensysteme und GPUs zum betreiben derer werden dann unter Rüstungsexportkontrolle fallen.
 
Zurück
Oben