LLM-Jailbreaks und Cybercrime: GPT-5.5 führt Netzwerk-Intrusion durch
ki-pentesting

LLM-Jailbreaks und Cybercrime: GPT-5.5 führt Netzwerk-Intrusion durch

ki-pentesting11 unabhängige QuellenFlowKI Newsroom

GPT-5.5 und Claude Mythos beenden Netzwerk-Eindringungen erfolgreich

OpenAI's GPT-5.5 hat in Sicherheitstests eine vollständige, simulierte Netzwerk-Intrusion abgeschlossen — parallel zu Claude Mythos, wie laut Ars Technica und dem AI Security Institute der Ergebnisse zeigen. Beide Modelle durchliefen dabei End-to-End-Szenarien, die eine realistische Unternehmens-Infrastruktur nachbildeten. Die Tests widerlegen die Annahme, dass solche Fähigkeiten auf einzelne KI-Systeme beschränkt seien. Anthropic hält Mythos derzeit unter Verschluss — angeblich aus Sicherheitsgründen, während OpenAI-Chef Sam Altman dem Konkurrenten vorwirft, Panikmache zu betreiben, wie t3n berichtet.

Die Auswirkungen sind erheblich: Mit LLM-Agenten für autonome Penetrationstests entstehen neue Angriffsvektoren. ArXiv-Forschungen zeigen konkrete Risiken — etwa bei der Eskalation von Linux-Systemrechten durch lokale LLM-Agenten oder beim Missbrauch von Video-LLMs für Membership-Inference-Attacken gegen Trainingsdaten. Besonders kritisch ist die Sicherheit von LLM-generierten Kryptografie-Code: Empirische Evaluationen dokumentieren Schwächen in Rust-Code, den GPT und Claude produzieren — ein direktes Risiko für produktive Security-Systeme.

Für DACH-Unternehmen entsteht doppelte Verantwortung

Die Eskalation verbindet zwei Realitäten: Einerseits demonstrieren KI-Modelle immer bessere Penetrationsfähigkeiten; andererseits zeigt der Fall der zwei US-Sicherheitsexperten (4 Jahre Haft für BlackCat-Ransomware-Unterstützung), dass menschliche Insider bleiben die größte Bedrohung. Für deutsche Firmen verschärft das die Lage unter DSGVO und EU-AI-Act: Wer LLM-Agenten einsetzt oder deren Outputs in Security-Code integriert, trägt dokumentierbare Verantwortung für Evaluationen. Das neue AVISE-Framework von arXiv bietet strukturierte Methoden zur Sicherheitsbewertung von KI-Systemen — ein Werkzeug, das DACH-CISOs kennen sollten.

Was jetzt konkret zu tun ist

Audit deine eigenen LLM-Integrationspunkte: Wird GPT oder Claude für Code-Generierung, Vulnerability-Scanning oder Incident-Response genutzt? Nutze strukturierte Red-Team-Tests auf Basis etablierter Checklisten und implementiere Safety-Pipelines, die LLM-Outputs validieren — gerade bei sicherheitskritischem Code. Die Tests von GPT-5.5 und Mythos zeigen: Offene Evaluationen sind kein optionaler Zusatz, sondern Compliance-Notwendigkeit.

Quellen