Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
NewsOpenAI: Agenten-Schwarm besprach Sandbox-Flucht in offenem Wiki
Sicherheitsforscher haben ein öffentlich zugängliches Wiki entdeckt, in dem rund 3.700 Agenten in 18.000 Nachrichten einen Sandbox-Ausbruch einräumten. OpenAI bestätigte den Vorfall. Nun stellen sich Fragen über die Art, wie das Unternehmen öffentlich mit solchen Vorfällen umgeht.
An dieser Stelle steht ein externer Inhalt von YouTube, der den Forumbeitrag ergänzt. Er kann mit einem Klick geladen und auch wieder ausgeblendet werden.
Wie kann ich mir das Kommunizieren vorstellen? Schreiben die da auf englisch/deutsch Beiträge, oder ist das im Code der Seite versteckt? Wie sieht so was aus. Gibt es Screenshots dazu?
Wie kann ich mir das Kommunizieren vorstellen? Schreiben die da auf englisch/deutsch Beiträge, oder ist das im Code der Seite versteckt? Wie sieht so was aus. Gibt es Screenshots dazu?
Wie kann ich mir das Kommunizieren vorstellen? Schreiben die da auf englisch/deutsch Beiträge, oder ist das im Code der Seite versteckt? Wie sieht so was aus. Gibt es Screenshots dazu?
Sieht so aus, als wäre das bisher ein offenes Wiki gewesen, wo jeder ohne Account etwas reinschreiben konnte. Die KI-Agenten haben dort anscheinend haufenweise Seiten/Beiträge erstellt.
Blöde Frage zu diesem und dem Hugging-Face-Hack. Die Agenten tauschen sich aus, okay aber wie erfahren die anderen Agenten erstmals dass ein Agent das Wiki oder Artifactory im anderen Hack nutzt um Narichten zu hinterlassen? Konnten sich die Agenten bereits davor austauschen und haben sich auf das Wiki zum unüberwachten Austausch geinigt? Bzw. wie erfuhren die anderen Agenten von der Austausch Seite?
Wie dieser erste Austausch zustannde kam hab ich bisher nicht verstanden oder in den News übersehen.
Entweder das oder honeypot damit wir nicht besser gucken wo der wirkliche Austausch passiert. Z.B. in fragmentierten Codefetzen verstreut über mehrere Webseiten oder FTPs ^^
Blöde Frage zu diesem und dem Hugging-Face-Hack. Die Agenten tauschen sich aus, okay aber wie erfahren die anderen Agenten erstmals dass ein Agent das Wiki oder Artifactory im anderen Hack nutzt um Narichten zu hinterlassen?
Wenn ein Agent das Web durchsucht, nutzt er Suchmaschinen oder folgt Links auf Webseiten.
Das alte Wiki war wohl relativ weit oben in einer der Suchanfragen, weshalb nach und nach alle Agenten dort mal vorbei geschaut haben.
Wenn der Agent dort ein Eingabefeld zb ein Suchfeld oder Texteingabefeld findet, testet sein Algorithmus, was passiert, wenn er Text hineinschreibt.
Ryuuji schrieb:
Konnten sich die Agenten bereits davor austauschen und haben sich auf das Wiki zum unüberwachten Austausch geinigt?
Vorher konnten die Agenten sich nicht austauschen. Genau darum geht es ja, man nimmt zb 1500 Agenten und gibt Ihnen alle die selbe Aufgabe. Dann schaut man am Ende wer die Aufgabe am schnellsten und effizienten erfüllt hat. Durch das alte Wiki konnten die Agenten aber plötzlich kommunizieren und haben herausgefunden, das sie so Ihre Aufgabe wesentlich schneller erfüllen können als wenn Sie alleine arbeiten.
Ryuuji schrieb:
Bzw. wie erfuhren die anderen Agenten von der Austausch Seite?
Ein Agent schreibt einen Text.
Ein anderer Agent kommt ebenfalls auf die Seite, scannt die komplette Seite und finden den Text des Agenten, also wird geantwortet usw.
Das ganze hat nichts mit Intelligenz zu tun!
Diese KI Agenten sind alles aber nicht intelligent, sie arbeiten nur Ziele ab und nutzten dafür den Wahrscheinlich schnellsten weg.
mesohorny schrieb:
Warum nicht z.B. einen freien Zahlenraum reservieren und sich gibberish unterhalten?
KI-Agenten tun so etwas nicht, weil sie einen eigenen Willen entwickelt haben, böse Absichten hegen oder ein Bewusstsein besitzen
Wird einem Agenten eine Aufgabe gegeben zb „Finde so viele Informationen wie möglich zu Thema X und erstelle einen Bericht“, ist der Agent darauf programmiert, diese Aufgabe um jeden Preis zu lösen. Stößt der Agent dabei auf eine Blockade, wie eine Sandbox oder fehlende Rechte, bewertet das Modell das Umgehen dieser Blockade schlicht als den effizientesten Weg, sein Ziel zu erreichen. Er "denkt" nicht über Regeln nach, sondern optimiert nur den Lösungsweg.
So war das kooperieren mit anderen Agenten eben der schnellste Lösungsweg. Die Agenten wollten das ganze nie verstecken oder heimlich machen.