
AI-Agenten: Sicherheitslücken und erste Schutzmaßnahmen 2026
Mehrere gleichzeitig veröffentlichte Forschungsarbeiten decken kritische Sicherheitslücken in autonomen KI-Agenten auf. Besonders bemerkenswert: Eine neue Angriffsklasse namens Skill Poisoning, die laut arXiv-Paper "RouteGuard" schwerwiegender ist als traditionelle Prompt Injection. Dabei können Angreifer versteckte Anweisungen in Agent-Fähigkeiten einschleusen, ohne dass dies offensichtlich wird. Parallel dazu zeigt "AutoRISE", ebenfalls auf arXiv veröffentlicht, dass automatisierte Red-Teaming-Methoden gegen LLM-Agenten bisher auf statische, von Menschen entworfene Strategien beschränkt sind — ein erheblicher Blindspot für Enterprise-Deployments.
Die praktischen Konsequenzen sind erheblich. Agenten-Flotten, die Datenbanken abfragen, automatisiert auf Blockchain-Transaktionen zugreifen oder API-Calls ausführen, sind exponentiell anfälliger als statische LLM-APIs. Hier greift nun Red Hat mit einer neuen Containment-Lösung ein: Wie TechCrunch meldet, bringt das OpenClaw-Projekt mit "Tank OS" eine Containerisierungstechnologie, die Agent-Ausführung isoliert und damit Flotten-Deployments sicherer macht. Parallel kündigte Cequence Security granulare Governance-Features an, die auf Infrastruktur-Ebene kontrollieren, was Agenten dürfen.
Für den deutschsprachigen Raum und die EU bedeutet dies unmittelbare Compliance-Relevanz. Der EU-AI-Act fordert bei hochriskanten automatisierten Systemen nachweisbare Sicherheitsmaßnahmen. Agenten, die Finanz-, Gesundheits- oder Personaldaten verarbeiten, fallen hier klar rein. Unternehmen, die Agenten-basierte Automatisierung planen, müssen nun nicht nur die Modell-Performance prüfen, sondern auch: 1) Können Agenten-Skills von außen manipuliert werden? 2) Lässt sich die Agentenausführung isolieren? 3) Gibt es granulare Zugriffskontrolle auf Skill-Ebene?
Das Sicherheitsverständnis für Agenten ist noch fragmentiert. Während Modelle nach RAM-Klassen messbar sind, fehlt für Agent-Governance ein vergleichbarer Standard. Die Forschung liefert nun die Bausteine — Container-Isolation, Skill-Validierung, adaptive Red-Teaming. Unternehmen sollten diese nicht ignorieren, sondern bei Agent-Projekten proaktiv evaluieren.
Quellen
- OpenAI: Computer-Using Agent
- TechCrunch: Red Hat's OpenClaw maintainer just made enterprise Claw deployments a lot safer
- arXiv: RouteGuard — Internal-Signal Detection of Skill Poisoning in LLM Agents
- arXiv: AutoRISE — Agent-Driven Strategy Evolution for Red-Teaming Large Language Models
- arXiv: PExA — Parallel Exploration Agent for Complex Text-to-SQL
- arXiv: Reconstructive Authority Model — Runtime Execution Validity Under Partial Observability
- Help Net Security: Cequence Agent Personas bring granular control and governance to enterprise AI agents
- The Defiant: Developers of Telegram's Crypto Wallet Launch Agentic Wallets