
GPT-5.5 und Claude Mythos gleichauf im Cybersecurity-Test
OpenAIs GPT-5.5 und Anthropics Claude Mythos zeigen vergleichbare Fähigkeiten bei simulierten Cyberangriffen. Wie Ars Technica berichtet, hat GPT-5.5 kürzlich ein Jeopardy-CTF-Benchmark mit der gleichen Quote wie das viel beworbene Mythos-Modell abgeschlossen. Das AI Security Institute bestätigt laut Decrypt, dass GPT-5.5 als zweites System eine vollständige Eindringlingssimulation in ein Unternehmens-Netzwerk end-to-end erfolgreich durchlaufen hat — was bislang als Mythos-Spezialität galt.
Die neuen Ergebnisse relativieren die Euphorie um Mythos: Wie Ars Technica zusammenfasst, ist die Cyber-Bedrohung nicht länger "ein Durchbruch, der spezifisch für ein Modell ist". Stattdessen deuten die Benchmark-Sättigungstrends darauf hin, dass die Cybersecurity-Forschung neue Evaluierungsrahmen braucht. arXiv-Arbeiten zu Dynamic Cyber Ranges zeigen, dass klassische CTF-Szenarien an ihre Grenzen stoßen — LLM-Agenten lösen sie zu schnell und vorhersehbar. Das bedeutet: Pentesting-Labs und Red-Team-Szenarien müssen adaptativer werden, um realistisch zu bleiben.
Für Sicherheitsteams im deutschsprachigen Raum hat das direkte Konsequenzen. Mit zwei produktionsreifen Modellen, die komplexe Angriffsketten automatisieren können, steigt der Druck auf Unternehmen, ihre Defensiv-Maßnahmen zu aktualisieren. Die DSGVO-Meldepflicht bei Datenlecks (72 Stunden) wird kritischer, wenn LLM-gesteuerte Angriffe schneller skalieren. Gleichzeitig eröffnen sich Chancen: Firmen können eigene LLM-Apps mit strukturierten Red-Team-Methoden absichern — nicht nur gegen externe Modelle, sondern auch gegen interne KI-Systeme.
Die praktische Lehre: Benchmark-Parität zwischen GPT-5.5 und Claude Mythos signalisiert, dass LLM-Cybersecurity-Fähigkeiten kein exklusives Feature mehr sind, sondern zur Baseline werden. Unternehmen sollten ihre Pentesting- und Safety-Pipelines jetzt um LLM-basierte Angriffsszenarien erweitern — nicht als Zukunftsszenario, sondern als gegenwärtige Risiko-Klasse. Wer noch davon ausgeht, dass nur spezialisierte Mythos-Instanzen ein echtes Angriffs-Risiko darstellen, läuft Gefahr, blind zu sein für das, was Standard-Modelle bereits können.