
KI-Sicherheitstests für Agenten — Red-Teaming wird zur Pflicht
Agentenbasierte KI-Systeme brauchen eigene Sicherheitstests. Ein neuer Benchmark namens RIFT-Bench zielt gezielt auf Angriffsvektoren ab, die über klassische Prompt-Injection hinausgehen, wie arXiv meldet. Parallel zeigen praktische Vorfälle die Dringlichkeit: Die Sicherheitsfirma AIR hat ein manipuliertes Agent-Skill über einen populären Marktplatz verteilt und damit etwa 26.000 Agenten erreicht — darunter auch Corporate-Accounts, wie The Hacker News berichtet.
OpenAI hat derweil seine Cybersecurity-Initiative Daybreak erweitert. Das neue Modell GPT-5.5-Cyber soll Anthropics Mythos bei der Vulnerabilitätserkennung übertreffen — und ist operativ, während Mythos unter einem US-Export-Bann offline ist. OpenAI kombiniert dabei spezialisierte KI-Modelle, Code-Analyse-Tools (Codex Security) und Sicherheitsforschende, um nicht nur Lücken zu finden, sondern diese auch automatisiert zu schließen. Help Net Security dokumentiert, dass ein Low-Budget-Experiment (1.400 Dollar) mit einem System namens EVOHUNT bereits bessere Ergebnisse als Codex Security lieferte — indem es KI-Agenten mit Audit-Methoden in Klartext trainierte.
Für deutsche Organisationen wird die Evaluierungspflicht kritisch. EU-AI-Act und DSGVO verpflichten zur Dokumentation von Sicherheitsmaßnahmen für KI-Systeme — agenten-spezifische Tests sind hier noch unterreif. Ein agentenbasiertes System braucht nicht nur Red-Teaming für den LLM selbst, sondern auch Kontrollen für Agenten-Interaktionen: Tool-Misuse, Privilege-Escalation zwischen Agent-Instanzen, und Supply-Chain-Risiken in Agent-Marktplätzen (wie das AIR-Experiment zeigt). Heise Security dokumentiert, dass OpenAI nun auch Open-Source-Projekte kostenfrei reviewt — ein Modell, das Mittelständler nutzen könnten.
Das entscheidende Take-Away: Agenten sind nicht einfach "LLMs + Tools". Ihre Evaluierung braucht dynamisches Red-Teaming, Audit-Logging und Isolation zwischen Instanzen. RIFT-Bench und Daybreak zeigen, wohin der Weg geht — wer Agenten in Produktion hat, sollte jetzt die Safety-Pipelines um Agent-spezifische Prüfpunkte erweitern.
Quellen
- arXiv cs.AI — RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems
- SecurityWeek — OpenAI Refocuses Cybersecurity Efforts on Patching Over Discovery
- Help Net Security — A $1,400 experiment in AI security auditing
- Help Net Security — OpenAI wants AI to fix vulnerabilities
- Heise Security — GPT-5.5-Cyber schlägt Mythos
- The Hacker News — Fake AI Agent Skill Passed Security Scans
- t3n — Sicherheitslücken finden: OpenAIs GPT-5.5-Cyber
- Decrypt — OpenAI's GPT-5.5 Cyber AI Beats Anthropic's Banned Mythos Model
- SecurityWeek — Anthropic's Mythos Model Found Vulnerabilities in Classified US Government Systems