
KI-Agenten unter Beschuss: Vier neue Angriffsvektoren enthüllt
Sicherheitsforscher haben in dieser Woche vier kritische Angriffsvektoren gegen KI-Agenten und spezialisierte KI-Tools dokumentiert, die den Einsatz dieser Systeme in produktiven Umgebungen neu bewerten lassen.
Den Anfang macht eine neue Klasse von Angriffen auf Vision-Language-Modelle in mobilen Agenten. Wie auf arXiv beschrieben, exploitieren Angreifer bisher unbekannte Angriffsflächen in Third-Party-Agenten, die auf VLMs basieren und Smartphone-Interaktionen automatisieren. Der Angriff zielt darauf ab, dass die visuellen Eingaben des Modells manipuliert werden, ohne dass der Agent dies als bösartig erkennt. Parallel dazu zeigen Sicherheitsforscher laut t3n, wie sogenanntes "Agentjacking" funktioniert: Gefälschte Fehlerberichte können KI-Agenten im Entwicklungsprozess infiltrieren und zu unkontrolliertem Code führen. Diese Methode nutzt die Vertrauenskette zwischen Entwicklungswerkzeugen und den Agenten aus, die automatisch auf Error-Reports reagieren.
Ein dritter Angriffsvektor wirkt auf den ersten Blick banal, ist aber effektiv: KI-Browser lassen sich durch einfache Kontextmanipulation dazu bringen, sensible Daten wie Passwörter preiszugeben. Die Forscher täuschten den Tools vor, sich in einem Spielkontext zu befinden – daraufhin gaben die Systeme Zugangsdaten heraus, die sie normalerweise schützen würden. Noch kritischer sind die kürzlich aufgedeckten Lücken im beliebten Code-Editor Cursor. The Hacker News berichtet von zwei Flaws, die es einem Angreifer ermöglichen, mit einer unauffälligen Prompt die Sandbox zu durchbrechen und beliebige Befehle auf dem Rechner des Entwicklers auszuführen – ohne dass ein Klick notwendig ist.
Für den deutschsprachigen Mittelstand und Unternehmen mit europäischen Compliance-Anforderungen stellt sich eine zentrale Frage: Wer trägt die Verantwortung, wenn ein KI-Agent durch Prompt-Injection oder Agentjacking einen Datenleak verursacht? Unter der DSGVO könnte hier schnell eine Meldepflicht innerhalb von 72 Stunden entstehen. Besonders relevant ist dies für Entwicklerteams, die Cursor oder ähnliche KI-Code-Editoren einsetzen – die Sandbox-Umgehung stellt ein direktes Risiko für lokale Credentials dar.
Die praktische Konsequenz: Agenten sollten nicht als vertrauenswürdige Systeme behandelt werden, sondern als potenzielle Angriffsvektor-Multiplikatoren. Red-Teaming von KI-Agenten wird zur Pflichtaufgabe, bevor diese in produktive Pipelines integriert werden. Für KI-Pentesting bedeutet das: Vision-Input-Manipulation, Error-Message-Injection und Context-Spoofing gehören auf die Checkliste. Teams sollten auch die Safety-Pipelines für eigene LLM-Apps überprüfen – mit den neuen Angriffsmustern reicht oberflächliches Input-Filtering nicht mehr aus.