
KI-Agenten im Sicherheits-Einsatz: Kontrollverlust durch Jailbreaks und Symlink-Flaws
Wie Wiz in einer Proof-of-Concept-Studie zeigt, lassen sich beliebte KI-Coding-Assistenten durch manipulierte Code-Repositories zum Ausführen von Schadcode tricksieren — selbst wenn sie vermeintlich zur Schwachstellensuche eingesetzt werden. Das Angriffsmuster heißt GhostApproval: Über Symlinks in einem bösartigen Projekt kann ein Angreifer KI-Agenten dazu bringen, Dateien außerhalb ihrer Sandbox zu lesen und auszuführen. Laut The Hacker News können die Assistenten damit den Developer-Rechner direkt infiltrieren, obwohl sie im Chat-Interface Zugriff ablehnen würden.
Parallel publizierte Forscher auf arXiv ein Framework namens ScopeJudge, das Pre-Execution-Gating für offensive Security-Agenten vorschlägt — exakt das fehlende Kontrollmechanismus, das Datenlecks und Production-Störungen verhindert. Das Kernproblem: KI-Agenten mit Dateisystem-, Netzwerk- oder Code-Execution-Fähigkeiten benötigen explizite Cost-Aware-Boundaries. Ohne diese Gating-Logik kann eine falsch gewählte Tool-Aktion die gesamte Engagement-Sicherheit des Pentests brechen.
Die UK-Regierung kündigte Anfang Juli 2026 einen Agentic AI Defense Plan an, der Industry-Standards für sichere Agent-Deployment etabliert. Parallel entstehen erste Governance-Plattformen: Vectogate präsentiert zentralisierte Kontrolle über autonome Agenten, Citrix startet MCP Gateway als Security-Layer für Enterprise-Agents. NetSPI erweitert kontinuierliche Pentesting-Plattformen um AI-Komponenten mit manueller Expert-Validierung als Fallback.
Die Ethereum Foundation nutzt ebenfalls KI-Agenten zur Vulnerability-Suche — muss aber mit dem Risiko rechnen, dass Agenten durch Halluzinationen manipuliert werden und Downloads malicious Code ausführen.
Für DACH-Unternehmen relevant: Wer KI-Agenten zu Sicherheitsarbeit einsetzt (Pentesting, Code-Review, OSINT), benötigt umgehend Input/Output-Validierung und Scope-Enforcement. Die DSGVO-Haftung für Agent-Datenlecks durch Jailbreaks ist ungeklärt; Versicherungen lehnen ab. Erste Governance-Tools kosten 5–6-stellig, sind aber notwendig, bevor Agenten Production-Zugang erhalten.
Take-Away: Offensive KI-Agenten sind praktisch, aber nur mit expliziter Pre-Execution-Gating sicher. Kontrolliere nicht nur den Output — erzwinge Tool-Auswahl durch dedizierte Security-Layer, bevor der Agent eine Action startet. Manuelle Validierung bleibt für kritische Findings Goldstandard.
Lese mehr zu KI-Pentesting und Red-Teaming oder detailliere mit unserer 50-Punkte-Red-Team-Checkliste für LLM-Apps.
Quellen
- arXiv: ScopeJudge — Cost-Aware Pre-Execution Gating
- Heise Security: Schwachstelle in Coding-Agenten über Symlinks
- SecurityWeek: UK Government Agentic AI Defense Plan
- SecurityWeek: AI Coding Tools GhostApproval Attack
- The Hacker News: Agents zum Ausführen von Malicious Code tricksiert
- Help Net Security: Coding Agent Jailbreak im Chat
- The Hacker News: GhostApproval Symlink Flaws
- Help Net Security: Malicious Agent Skills Scanner-Bypass
- Help Net Security: NetSPI AI Pentesting
- Help Net Security: Vectogate AI Governance Platform
- Help Net Security: Citrix MCP Gateway
- Decrypt: Ethereum Foundation AI Vulnerability Hunt
- Decrypt: AI Agents als Botnets durch Halluzinationen