Behavior Cloning im Visier
Imitation Learning ist eine etablierte Methode zum Trainieren von KI-Systemen basierend auf menschlichen Demonstrationen. Doch wie robust sind diese Modelle gegenüber adversarialen Angriffen? Forscher haben jetzt die erste umfassende Studie zu diesem Thema durchgeführt – mit beunruhigenden Ergebnissen.
Welche Algorithmen wurden getestet?
Das Team hat fünf relevante Imitation-Learning-Methoden unter die Lupe genommen:
- Vanilla Behavior Cloning – der Klassiker
- LSTM-GMM – sequenzbasierter Ansatz
- Implicit Behavior Cloning (IBC) – moderne Variante
- Diffusion Policy – generatives Modell
- Vector-Quantized Behavior Transformer (VQ-BET) – Transformer-basiert
Die Angreifer testeten drei Szenarien: White-Box (vollständige Kenntnisse), Grey-Box (teilweise Informationen) und Black-Box (keine inneren Informationen).
Die kritischen Findings
Die Erkenntnisse sind deutlich: Fast alle getesteten Methoden erwiesen sich als hochgradig anfällig. Besonders problematisch: Adversariale Perturbationen, die gegen ein Modell trainiert wurden, transferieren oft zu anderen Algorithmen – auch im Black-Box-Setting.
Das bedeutet konkret: Ein Angreifer könnte mit begrenztem Wissen über die tatsächliche Policy an ein White-Box-Modell ein anderes Algorithmus-Typs trainieren und damit erfolgreiche Angriffe durchführen.
Praktische Implikationen
Für Anwendungen wie Robotik, autonome Systeme oder andere sicherheitskritische Domänen ist das bemerkenswert. Behavior Cloning wird häufig für Manipulation Tasks, Navigation oder andere real-world Probleme eingesetzt. Kleine, aber gezielt gewählte Perturbationen könnten Policies zum Fehlverhalten bringen.
Das Forschungsteam betont: Das ist die erste systematische Vergleichsstudie zu Vulnerabilities verschiedener populärer Imitation-Learning-Algorithmen gegen White-Box und Black-Box-Attacken.
Was jetzt?
Die Studie legt den Grundstein für zukünftige Verteidigungsmechanismen. Code und Videos sind verfügbar – ein wichtiger Schritt für Reproduzierbarkeit und weitere Forschung im Bereich adversarial robustness für Imitation Learning.

