Das AI Now Institute hat mit „Friendly Fire“ eine Angriffsmethode gegen KI-Sicherheitsassistenten vorgestellt. Ein Proof of Concept soll zeigen, dass Sicherheitswerkzeuge , die eigentlich beim Aufspüren von Schwachstellen helfen sollen, selbst zum Einfallstor werden können.
Versteckte Anweisungen in Quellcode und Dokumentation
Im Proof of Concept zeigen die Autoren des AI Now Institute, wie genau so etwas passieren kann: Sicherheitswerkzeuge, die Risiken finden sollen, lassen sich unter Umständen selbst missbrauchen.
Besonders brisant ist das, weil viele Teams solche KI-Sicherheitsassistenten inzwischen ganz selbstverständlich einsetzen, um Open-Source-Pakete, fremde Bibliotheken oder externe Code-Bausteine automatisiert auf Risiken zu prüfen.
Nach Darstellung des AI Now Institute funktioniert der Angriff dann, wenn versteckte Anweisungen in Quellcode, Kommentaren oder Dokumentationen untergebracht werden.
Wenn ein KI-Sicherheitsassistent diese Inhalte bei einem Sicherheitscheck einliest, kann er die eingebetteten Befehle fälschlich als legitime Arbeitsanweisung verstehen. Im schlimmsten Fall führt das laut AI Now Institute dazu, dass der Assistent auf dem Rechner des Nutzers unerwünschte oder sogar schädliche Schritte ausführt.
OpenAI und Anthropic im Testszenario anfällig
Nach Angaben der Autoren waren in dem Testszenario auch populäre Ökosysteme von OpenAI und Anthropic anfällig.
Das heißt nicht automatisch, dass jedes Produkt von OpenAI oder Anthropic sofort kompromittiert werden kann. Die Studie des AI Now Institute macht aber klar, dass die Risiken nicht bloß auf dem Papier existieren und Unternehmen ihre Sicherheitsautomatisierung kritischer prüfen sollten.
Schwierige Trennung zwischen Inhalt und Instruktion
Die Autoren beschreiben das Problem nicht als gewöhnlichen Softwarefehler, den man mit einem simplen Patch aus der Welt schafft.
Das eigentliche Problem liegt ihrer Einschätzung nach an der Vertrauensgrenze. Solche Systeme tun sich oft schwer damit, harmlose Inhalte sauber von versteckten, bösartigen Instruktionen in nicht vertrauenswürdigen Quellen zu trennen.
Gerade bei Tools, die selbstständig analysieren, priorisieren und teilweise auch Aktionen anstößen, ist das heikel.
Denn mit jedem zusätzlichen Recht und jedem weiteren Zugriff wächst laut AI Now Institute auch der mögliche Schaden, wenn sich diese Werkzeuge in die Irre führen lassen.
Verteidigung und Angriff entwickeln sich parallel
Für das AI Now Institute passt der Vorfall in eine größere Entwicklung.
Unternehmen setzen solche Systeme inzwischen unter anderem für Bedrohungserkennung, Betrugsüberwachung, Phishing-Abwehr, Penetrationstests und Cloud-Sicherheit ein. Gleichzeitig profitieren auch Angreifer davon: Phishing-Nachrichten wirken glaubwürdiger, Schadsoftware passt sich an, und Angriffsabläufe laufen immer stärker automatisiert ab.
Die Studie des AI Now Institute verweist außerdem auf dokumentierte, koordinierte Spionageaktivitäten, von denen weltweit rund 30 Organisationen betroffen gewesen sein sollen.
Sicherheitsexperten warnen zudem, dass selbst menschliche Kontrolle nicht immer ausreicht, wenn Systeme mit hohem Tempo arbeiten, ihre Ergebnisse überzeugend formulieren und Analysten unter Zeitdruck stehen. Für Firmen heißt das: Wer automatisierte Sicherheitshelfer tief in Entwicklungs- und Prüfprozesse einbindet, sollte Zugriffe streng begrenzen, unzuverlässige Eingaben isolieren und Ergebnisse nicht ungeprüft ausführen lassen.
Downloads: Keine Downloads verfügbar