Die öffentliche Spur lässt sich datieren. Anfang 2025 stellte Googles Threat Intelligence Group (GTIG) fest, dass staatlich unterstützte Akteure generative KI als Produktivitätswerkzeug nutzen: Übersetzung, Skripthilfe, Fehlersuche, Recherche. Gegen Ende 2025 berichtete dasselbe Team über Schadsoftware, die während der Ausführung ein Modell kontaktiert, sowie über einen reifenden Untergrundmarkt für illegale KI-Werkzeuge. Anthropic legte offen, eine Erpressungsoperation abgeschaltet zu haben, die in nahezu jeder Phase auf KI setzte – von Aufklärung und Zugangsdatensammlung bis zur Festlegung der Lösegeldforderung.
Im Mai 2026 meldete GTIG, dass Cyberkriminelle in einem quelloffenen Administrationswerkzeug einen Weg zur Umgehung der Zwei-Faktor-Authentifizierung fanden und funktionierende Exploits dafür bauten. Aus Struktur und Inhalt dieser Exploits leitete GTIG mit hoher Zuversicht ab, dass ein KI-Modell sowohl die Entdeckung als auch die Exploit-Entwicklung unterstützt hat. GTIG stimmte die Offenlegung mit dem betroffenen Hersteller ab, störte die Aktivität und geht davon aus, dass der Fund den Einsatz des Exploits möglicherweise verhindert hat. Die Unterscheidung ist wichtig: Eingeschätzte KI-Unterstützung und eine geplante Operation sind nicht dasselbe wie bestätigter Einsatz in freier Wildbahn. Attribution bleibt schwierig, die Verbreitung unklar, und keiner dieser Berichte ist eine Vollerhebung.
Schutzmechanismen der Anbieter erhöhen die Kosten des Missbrauchs, doch sie liegen außerhalb des Unternehmens. Eine umformulierte Anfrage, ein Wechsel zu einem Modell mit offenen Gewichten, die Aufteilung einer bösartigen Aufgabe in ein Dutzend harmlos wirkender Schritte oder eigene Werkzeuge rund um das Modell umgehen die Richtlinienebene. Wer Anbieterrichtlinien als Sicherheitsgrenze behandelt, hat Beruhigung an die Stelle von Verteidigung gesetzt.
Lehrbücher zeichnen den Angriff als Linie – Aufklärung, Zugang, Rechteausweitung, Wirkung. Tatsächlich läuft er als Schleife: beobachten, vermuten, ausprobieren, Rückmeldung lesen, nachjustieren. KI verkürzt die Abstände. Die Verteidigung soll dieselbe Schleife drehen, wird aber an jedem Gelenk durch Warteschlangen und Übergaben unterbrochen. Mittlere Zeit bis zur Bestätigung und bis zur Behebung verdecken das: Ein Alarm kann in Minuten quittiert sein und danach stundenlang rekonstruiert werden. Diese Rekonstruktionsspanne ist Entscheidungslatenz – kaum ein SOC misst sie.
Das Beispiel der Serie: Ein Mitarbeiter der Finanzabteilung meldet sich über einen nie genutzten Hosting-Anbieter an, MFA ist erfüllt. Binnen zehn Minuten leitet eine neue Postfachregel an eine externe Adresse weiter, das Konto zieht in ungewohntem Muster Dateien aus einer Finanz-SharePoint-Seite. Threat Intelligence verfolgt eine Welle von Adversary-in-the-Middle-Phishing zum Diebstahl authentifizierter Sitzungen – weitergegeben wird nur eine kurze Warnung mit Indikatoren. Der Hunter entdeckt, dass Gerätekonformitätsdaten nur einen Teil der Umgebung abdecken und SharePoint-Protokolle Stunden verspätet eintreffen; die Einschränkungen bleiben zurück. Die Erkennungsregel geht mit Schweregrad und Beschreibungsfeld hinaus, ohne ihre Annahmen. Der Analyst baut das Bild über vier Konsolen neu auf, schließt den Fall mit der Empfehlung, das Konto zu deaktivieren – die konkurrierende Erklärung, das Konfidenzniveau und der nicht prüfbare, nicht verwaltete Endpunkt bleiben zurück. Beim Identity-Team landet ein Einzeiler, obwohl dort bekannt ist, dass das Konto mitten in einem Gehaltslauf steckt. Sitzungen widerrufen und die Weiterleitungsregel entfernen sind die risikoarmen Schritte; die Sperrung fällt unter die Vorfallsrichtlinie.
Die Antwort sei nicht der mythische Allrounder-Analyst, sondern Architektur: ein „statefuller“ SOC mit geteiltem operativem Gedächtnis, das Begründung, Unsicherheit und Handlungsbeschränkungen über Übergaben hinweg erhält. „Unbekannt“ muss dabei eine zulässige Antwort sein – fehlende Endpunkt-Telemetrie wird als nicht prüfbar vermerkt und die Abdeckungslücke einem Verantwortlichen zugewiesen, statt als „keine schädliche Prozessaktivität beobachtet“ zu verschwinden. Agentische KI kommt bewusst zuletzt, denn Agenten auf ein zustandsloses SOC zu schrauben, beschleunigt nur ein kaputtes Betriebsmodell. Befugnis bleibt von Konfidenz getrennt: beobachten, empfehlen, nach ausdrücklicher Freigabe ausführen oder automatisch handeln – Letzteres nur, wenn Richtlinie, Konfidenz, Entitätstyp und mögliche Auswirkung zusammenpassen; der Modus liegt versioniert und prüfbar im Steuerzustand. Auch Lernen braucht eine Prüfinstanz: Ein einzelnes Falschpositiv-Urteil rechtfertigt keine Änderung produktiver Erkennungslogik; der Vorschlag geht an den Regelverantwortlichen. Als Maßstab dienen vier Fragen statt gezählter Agenten-Aufgaben – und NIST weist in SP 800-61r3 in dieselbe Richtung, indem die Reaktion auf Vorfälle als Teil des übergreifenden Risikomanagements behandelt wird.
