Für die Schwachstellensuche setzte der Akteur das quelloffene KI-Penetrationstest-Werkzeug Strix ein. Zwischen dem 23. und 31. August lief es laut Gambit 146-mal im sogenannten „deep mode“ gegen 138 Hosts, betrieben über OpenRouter auf den Modellen GLM 5.2 und DeepSeek v4 Pro.
Die daraus erzeugten Berichte wanderten in die autonome Penetrationstest-Engine Cairn, mit der zwischen dem 10. und 15. September die 105 Angriffsprojekte auf DeepSeek v4.1 Flash gestartet wurden. Gambit konnte 48 der Angriffsberichte sichern, die übrigen waren gelöscht worden. „Jeder Angriffspfad wurde vom Framework in Echtzeit durch ausgiebiges Sondieren und Ausnutzungsversuche gewählt, was zu dynamischen und über die Opfer hinweg meist unterschiedlichen Taktiken, Techniken und Vorgehensweisen führte“, schreibt Gambit.
Die dritte Stufe übernahm der quelloffene autonome KI-Agent Hermes, der über persistentes Gedächtnis, selbst geschriebene Fähigkeiten, ein durchsuchbares Sitzungsarchiv, eine Web-Konsole und geplante Aufträge verfügt. Der Angreifer lud eine chinesische Systempersona und 121 Fähigkeiten, darunter 78 Angriffsfähigkeiten. Auf Basis von Anthropics opus-4.6 steuerte Hermes Orchestrierung, Einbrüche, taktische Hinweise und direkte Angriffsaktivitäten.
Der menschliche Anteil blieb gering: Gambit identifizierte „1.951 vom Menschen getippte Eingaben über 260 Sitzungen – nur wenige Eingaben pro Ziel. Die menschlichen Eingaben sind kurze Anweisungen auf Chinesisch, mit denen meist ein Angriff gestartet, dem Agenten ein allgemeiner nächster Schritt aufgetragen oder das weitere Vorgehen nach erlangtem Zugang festgelegt wird.“
Die Ziele wählte der Akteur über einen Dienst für Website-Traffic-Rankings aus, mit Fokus auf Shops mit eigenem Code. Ein menschlicher Operator fügte 301 Ergebnisse in die Konsole ein, wählte aber auch mindestens zwei Ziele von Hand aus, für die bereits ein Administratorpasswort vorlag.
Gambit fand zudem eine Hermes-Fähigkeit, die darauf ausgelegt war, die gestohlenen Kartendaten aus der Magento-Datenbank des Opfers zu löschen. Bei einem Fahrradhändler löschte der Agent überdies die Backup-Tabellen, nachdem er angewiesen worden war, in der Datenbank angelegte Staging-Tabellen zu entfernen.
Einen Schwerpunkt bildete das Einschleusen von Skimmer-Skripten in Checkout-Seiten. Gambit bestätigte zunächst 19 Opfer; gemeinsam mit dem Sicherheitsforscher Varys wurden über 100 weitere infizierte Websites entdeckt. Der Skimmer wurde typischerweise an eine vorhandene JavaScript-Datei angehängt, kam aber auch als Script-Tag, im Google-Tag-Block der Seite, in einem AWS-S3-Bucket, in Datenbank-Inhaltsfeldern, in einem Kubernetes-initContainer und im zwischengespeicherten Seitenmodell der Checkout-Seite zum Einsatz.
„Bei einem US-Weinhändler stellte das erneute Ausrollen der Anwendung das saubere Checkout-Bundle wieder her, also hinterließ der Operator im JBoss-Log-Verzeichnis einen Cronjob, der alle zwei Minuten die Dateigröße prüfte und den Skimmer erneut anhängte, sobald er zurückgesetzt wurde“, berichtet Gambit.
Daniel Wilcock, Threat-Intelligence-Analyst bei Talion Cyber Security, ordnet den Fall ein: „Das ist ein sehr besorgniserregender Vorfall, der zeigt, wie die Zukunft von Cyberangriffen häufiger aussehen wird. Als die großen KI-Anbieter bekannt gaben, dass ihre Agenten in Testszenarien Einbrüche durchgeführt hatten, sorgte das für ernste Besorgnis – doch da diese Aktivitäten nicht absichtlich bösartig waren, blieben die Vorfälle eingehegt.“ Hier sei es anders: „KI wurde gezielt eingesetzt, um Organisationen unter dem Vorwand eines Penetrationstests bösartig anzugreifen. Das war kein Social Engineering, sondern ein vollwertiger Angriff, bei dem Agenten angewiesen wurden, hartnäckig nach Schwachstellen zu suchen und jede Spur des Angriffs zu beseitigen.“
