KI-Agenten im Sicherheits-Einsatz: Kontrollverlust durch Jailbreaks und Symlink-Flaws
ki-pentesting

KI-Agenten im Sicherheits-Einsatz: Kontrollverlust durch Jailbreaks und Symlink-Flaws

ki-pentesting13 unabhängige QuellenFlowKI Newsroom

Wie Wiz in einer Proof-of-Concept-Studie zeigt, lassen sich beliebte KI-Coding-Assistenten durch manipulierte Code-Repositories zum Ausführen von Schadcode tricksieren — selbst wenn sie vermeintlich zur Schwachstellensuche eingesetzt werden. Das Angriffsmuster heißt GhostApproval: Über Symlinks in einem bösartigen Projekt kann ein Angreifer KI-Agenten dazu bringen, Dateien außerhalb ihrer Sandbox zu lesen und auszuführen. Laut The Hacker News können die Assistenten damit den Developer-Rechner direkt infiltrieren, obwohl sie im Chat-Interface Zugriff ablehnen würden.

Parallel publizierte Forscher auf arXiv ein Framework namens ScopeJudge, das Pre-Execution-Gating für offensive Security-Agenten vorschlägt — exakt das fehlende Kontrollmechanismus, das Datenlecks und Production-Störungen verhindert. Das Kernproblem: KI-Agenten mit Dateisystem-, Netzwerk- oder Code-Execution-Fähigkeiten benötigen explizite Cost-Aware-Boundaries. Ohne diese Gating-Logik kann eine falsch gewählte Tool-Aktion die gesamte Engagement-Sicherheit des Pentests brechen.

Die UK-Regierung kündigte Anfang Juli 2026 einen Agentic AI Defense Plan an, der Industry-Standards für sichere Agent-Deployment etabliert. Parallel entstehen erste Governance-Plattformen: Vectogate präsentiert zentralisierte Kontrolle über autonome Agenten, Citrix startet MCP Gateway als Security-Layer für Enterprise-Agents. NetSPI erweitert kontinuierliche Pentesting-Plattformen um AI-Komponenten mit manueller Expert-Validierung als Fallback.

Die Ethereum Foundation nutzt ebenfalls KI-Agenten zur Vulnerability-Suche — muss aber mit dem Risiko rechnen, dass Agenten durch Halluzinationen manipuliert werden und Downloads malicious Code ausführen.

Für DACH-Unternehmen relevant: Wer KI-Agenten zu Sicherheitsarbeit einsetzt (Pentesting, Code-Review, OSINT), benötigt umgehend Input/Output-Validierung und Scope-Enforcement. Die DSGVO-Haftung für Agent-Datenlecks durch Jailbreaks ist ungeklärt; Versicherungen lehnen ab. Erste Governance-Tools kosten 5–6-stellig, sind aber notwendig, bevor Agenten Production-Zugang erhalten.

Take-Away: Offensive KI-Agenten sind praktisch, aber nur mit expliziter Pre-Execution-Gating sicher. Kontrolliere nicht nur den Output — erzwinge Tool-Auswahl durch dedizierte Security-Layer, bevor der Agent eine Action startet. Manuelle Validierung bleibt für kritische Findings Goldstandard.

Lese mehr zu KI-Pentesting und Red-Teaming oder detailliere mit unserer 50-Punkte-Red-Team-Checkliste für LLM-Apps.

Quellen