Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
NewsSchwachstellen-Benchmark: GPT-5.5-Cyber von OpenAI übertrifft Claude Mythos 5
OpenAI baut Daybreak weiter aus und ergänzt seine Cyber-Sicherheitsinitiative um ein spezialisiertes KI-Modell für Sicherheitsforscher und Verteidiger. Auch Codex Security erhält neue Funktionen für die automatisierte Analyse und Behebung von Schwachstellen. Erste Benchmarks sehen die Kombination vor Claude Mythos 5.
Die Zahlen sehen toll aus. Trilliarden an Schwachstellen und Fehlern gefunden. Die Frage ist ja eher was davon ist wirklich so richtig Sicherheitsrelevant.
Aber Patch the Planet hört sich doch super an. Interessant wird es, wenn man Mythos alles analysieren und patchen läßt und dann mal shauen was Cyber anders machen würde 🤣
Ich verstehe da sowieso nicht was die aussagen sollen. Wichtig ist doch nur, dass kritische Fehler gefunden werden und die KI sagt, "ACHTUNG, das ist kritisch und SO kann man es beheben".
Irgendwie - und da bin ich bestimmt nicht die/der einzige - zucke ich bei diesen ganzen „Neuestes KI-Modell angeblich noch viel besser als irgendein anderes neues KI-Modell“-Meldungen mehr und mehr mit den Schultern und hoffe für uns alle, dass Skynet es am Ende dann einfach nur kurz und schmerzlos macht.
Irgendwie - und da bin ich bestimmt nicht die/der einzige - zucke ich bei diesen ganzen „Neuestes KI-Modell angeblich noch viel besser als irgendein anderes neues KI-Modell“-Meldungen mehr und mehr mit den Schultern und hoffe für uns alle, dass Skynet es am Ende dann einfach nur kurz und schmerzlos macht.
Mutmaßlich nicht, denn mit OpenAI hat Trump ja kein persönliches Problem. Die Fähigkeiten, die die US-Regierung bei Fable und Mythos moniert, hat in der Realität ja schließlich schon das völlig frei verfügbare GPT 5.5.
Und auch Open-Source-Modelle wie Qwen sind realistischerweise nicht allzu weit vom Level der Frontiers entfernt. Dieses undifferenzierte Totalverbot ist so einfach nicht sinnvoll.
Nee, so wirds nicht werden.
Erstmal wird die Kriegsführung revolutioniert. D.h. die Maschinen machen das so, dass man zu Hause nichts davon mitbekommt. Da werde ich nicht skeptisch.
Da muss man halt hoffen, dass keiner der Diktatoren der Welt gerade Bock bekommt, seine militarisierten Drohnen gegen einen selbst auszusenden. Z.B. weil er die Stimmung im eigenen Land aufbessern muss und dafür halt irgendwelche Erfolge im Ausland vorweisen möchte. Ist man ja gewohnt. Da werde ich nicht skeptisch.
Irgendwann werden dann ganze Schwärme automatisiert und sich selbst versorgen. Da werde ich nicht skeptisch.
Aber wenn wir dann auf einmal alle in Schale/Uniform geworfen werden um für ein Projekt zur Rettung der Menschheit zuzuarbeiten... wenn dieses Projekt dann "Zero Dawn" heißt.
@lordfritte Hört sich vom Konzept her danach an, dass genau das vermieden werden soll. Naütlich die Frage, wie am Ende die Umsetzung ist, aber diese pauschale Abwertung ist hier fehl am Platz.
Nee, so wirds nicht werden.
Erstmal wird die Kriegsführung revolutioniert. D.h. die Maschinen machen das so, dass man zu Hause nichts davon mitbekommt. Da werde ich nicht skeptisch.
Die müssen auch nicht offen Krieg führen, einfach teilweise sterilisieren und wir sterben in genau dem Masse aus wie für nötig erachtet ohne einen Menschen töten zu müssen.
Was man hier eigentlich mitnehmen sollte: Der (angeblich) in Silizium gegossene Todesstern namens Mythos liegt im gezeigten Benchmark stolze ~2% vor ChatGPT 5.5. Wow.
Ich hatte schon bei Vorstellung von Mythos gehört, dass das ganze aufgebauscht ist, aber dass der Abstand wirklich so klein ist, hätte ich nicht gedacht.
Mythos kann wohl wesentlich besser funktionierende Exploits für die gefundenen Lücken als GPT-5.5 Cyber schreiben.
Aber das Finden und Fixen der Lücken kann auch 5.5 sehr gut, ja. Offenbar wesentlich besser als Opus, das dahingehend mit jeder neuen Version stärker generft wird, was sehr bedauerlich ist. Hoffe, GPT wird nicht das gleiche Schicksal ereilen. Sonst wird GLM 5.2 für Audits absolute Pflicht...