News Schwachstellen-Benchmark: GPT-5.5-Cyber von OpenAI übertrifft Claude Mythos 5

mischaef

Kassettenkind
Teammitglied
Registriert
Aug. 2012
Beiträge
7.911
  • Gefällt mir
Reaktionen: schneeland, BrollyLSSJ und BorstiNumberOne
"Hey Claude, improve our GPT-5.5 model so that it beats Mythos"
...
Done.
 
  • Gefällt mir
Reaktionen: Pigeonzilla, sioh, the_IT_Guy und 7 andere
Spätestens seit Jim Keller sollte doch klar sein das Benchmarks nicht wirklich aussagekräftig sind.
 
  • Gefällt mir
Reaktionen: flo.murr, the_IT_Guy und Das_Oni
Die Zahlen sehen toll aus. Trilliarden an Schwachstellen und Fehlern gefunden. Die Frage ist ja eher was davon ist wirklich so richtig Sicherheitsrelevant.
Aber Patch the Planet hört sich doch super an. Interessant wird es, wenn man Mythos alles analysieren und patchen läßt und dann mal shauen was Cyber anders machen würde 🤣
R4nd0 schrieb:
Benchmarks nicht wirklich aussagekräftig sind.
Ich verstehe da sowieso nicht was die aussagen sollen. Wichtig ist doch nur, dass kritische Fehler gefunden werden und die KI sagt, "ACHTUNG, das ist kritisch und SO kann man es beheben".
 
Irgendwie - und da bin ich bestimmt nicht die/der einzige - zucke ich bei diesen ganzen „Neuestes KI-Modell angeblich noch viel besser als irgendein anderes neues KI-Modell“-Meldungen mehr und mehr mit den Schultern und hoffe für uns alle, dass Skynet es am Ende dann einfach nur kurz und schmerzlos macht.
 
  • Gefällt mir
Reaktionen: GuckenWasGeht, doalwa, Apple ][ und eine weitere Person
Wird das dann auch bald aber ganz sicher wegen der nationalen Sicherheit verboten?
 
  • Gefällt mir
Reaktionen: wüstenigel, trin94, Azdak und eine weitere Person
Also ich schau schon lange nicht mehr auf AI Benchmarks. Das ganze hat doch in der Realität gar keine Relevanz...
 
  • Gefällt mir
Reaktionen: the_IT_Guy, slow_snail und Kuristina
msv schrieb:
Irgendwie - und da bin ich bestimmt nicht die/der einzige - zucke ich bei diesen ganzen „Neuestes KI-Modell angeblich noch viel besser als irgendein anderes neues KI-Modell“-Meldungen mehr und mehr mit den Schultern und hoffe für uns alle, dass Skynet es am Ende dann einfach nur kurz und schmerzlos macht.

Dystopische Sci-Fi-Filme schön und gut... aber ich glaube, denke und weiß, dass so etwas nicht passieren wird.
 
  • Gefällt mir
Reaktionen: .:TechFreak:.
neutrongummi schrieb:
"Hey Claude, improve our GPT-5.5 model so that it beats Mythos"
...
Done.
Wäre ja sehr witzig, wenn das so funktionieren würde :D

Die Fragestellung, ob LLM1 ein LLM2 über das eigene Niveau hinaus verbessern kann, mutet ja beinahe schon philosophisch an :D

Flutefox schrieb:
Wird das dann auch bald aber ganz sicher wegen der nationalen Sicherheit verboten?
Mutmaßlich nicht, denn mit OpenAI hat Trump ja kein persönliches Problem. Die Fähigkeiten, die die US-Regierung bei Fable und Mythos moniert, hat in der Realität ja schließlich schon das völlig frei verfügbare GPT 5.5.
Und auch Open-Source-Modelle wie Qwen sind realistischerweise nicht allzu weit vom Level der Frontiers entfernt. Dieses undifferenzierte Totalverbot ist so einfach nicht sinnvoll.
 
  • Gefällt mir
Reaktionen: Azdak
Floorp schrieb:
Dystopische Sci-Fi-Filme schön und gut... aber ich glaube, denke und weiß, dass so etwas nicht passieren wird.
Nee, so wirds nicht werden.
Erstmal wird die Kriegsführung revolutioniert. D.h. die Maschinen machen das so, dass man zu Hause nichts davon mitbekommt. Da werde ich nicht skeptisch.

Da muss man halt hoffen, dass keiner der Diktatoren der Welt gerade Bock bekommt, seine militarisierten Drohnen gegen einen selbst auszusenden. Z.B. weil er die Stimmung im eigenen Land aufbessern muss und dafür halt irgendwelche Erfolge im Ausland vorweisen möchte. Ist man ja gewohnt. Da werde ich nicht skeptisch.

Irgendwann werden dann ganze Schwärme automatisiert und sich selbst versorgen. Da werde ich nicht skeptisch.

Aber wenn wir dann auf einmal alle in Schale/Uniform geworfen werden um für ein Projekt zur Rettung der Menschheit zuzuarbeiten... wenn dieses Projekt dann "Zero Dawn" heißt.

Spätestens dann könnte ich skeptisch werden... :D
 
  • Gefällt mir
Reaktionen: Apple ][ und msv
„Patch the Planet“ Damit die Opensource Community noch mehr AI Slop requests bekommt..
 
  • Gefällt mir
Reaktionen: GuckenWasGeht, l33ch0r, the_IT_Guy und eine weitere Person
@lordfritte Hört sich vom Konzept her danach an, dass genau das vermieden werden soll. Naütlich die Frage, wie am Ende die Umsetzung ist, aber diese pauschale Abwertung ist hier fehl am Platz.
 
Kommando schrieb:
Nee, so wirds nicht werden.
Erstmal wird die Kriegsführung revolutioniert. D.h. die Maschinen machen das so, dass man zu Hause nichts davon mitbekommt. Da werde ich nicht skeptisch.
Die müssen auch nicht offen Krieg führen, einfach teilweise sterilisieren und wir sterben in genau dem Masse aus wie für nötig erachtet ohne einen Menschen töten zu müssen. :daumen:
 
  • Gefällt mir
Reaktionen: Kommando
@ThirdLife Traurig aber wahr: Das ist eine der besten annähernd realistischen Zukunftsaussichten für die Menschheit.
 
jauns91 schrieb:
Und Trump schaltet es ab in 3...2...1.
Nö, macht er nicht, da Trump mit OpenAI nicht auf Kriegsfuß steht.
 
select * from ist keine verbesserung ;)
* ist ein klassischer angriff, wenn man alle daten abgreifen möchte

wird sogar von der KI empfohlen es nicht zu benutzen :D
 
  • Gefällt mir
Reaktionen: l33ch0r
In einigen Jahren: SENSATION! Claude schlägt GPT mit 0,000001% Vorsprung
dr evil finger an den mund halt
 
Was man hier eigentlich mitnehmen sollte: Der (angeblich) in Silizium gegossene Todesstern namens Mythos liegt im gezeigten Benchmark stolze ~2% vor ChatGPT 5.5. Wow.

Ich hatte schon bei Vorstellung von Mythos gehört, dass das ganze aufgebauscht ist, aber dass der Abstand wirklich so klein ist, hätte ich nicht gedacht.
 
  • Gefällt mir
Reaktionen: FX9590
Mythos kann wohl wesentlich besser funktionierende Exploits für die gefundenen Lücken als GPT-5.5 Cyber schreiben.
Aber das Finden und Fixen der Lücken kann auch 5.5 sehr gut, ja. Offenbar wesentlich besser als Opus, das dahingehend mit jeder neuen Version stärker generft wird, was sehr bedauerlich ist. Hoffe, GPT wird nicht das gleiche Schicksal ereilen. Sonst wird GLM 5.2 für Audits absolute Pflicht...
 
Zurück
Oben