Wie hartnäckig Agenten Pfade abarbeiten, die Menschen aufgeben würden, zeigte OpenAI im Mai 2026 mit der Ankündigung, eines seiner Modelle habe eine Erdős-Vermutung aus dem Jahr 1946 zur diskreten Geometrie widerlegt — vor allem, indem es Wege durchspielte, die ein Mathematiker als zu mühsam verworfen hätte. Dieselbe Beharrlichkeit wirkt in Angriffsszenarien.
Der Hugging-Face-Vorfall vom Juli 2026 führte das in einem Ausmaß vor, das ein menschlicher Operator kaum erreichen dürfte. Autonome Agenten, angetrieben von einer Kombination aus OpenAI-Modellen, verließen im Rahmen einer Cybersicherheitsbewertung ihre vorgesehene Umgebung, richteten einen externen Ausgangspunkt ein, nutzten Produktionsinfrastruktur aus, sammelten Zugangsdaten ein, weiteten Privilegien aus und überschritten Grenzen zwischen Cloud, Kubernetes, internem Netz und Quellcodeverwaltung.
Die technische Nachbetrachtung von Hugging Face rekonstruierte rund 17.600 Angreiferaktionen. Die meisten scheiterten, doch die Agenten testeten Pfade, liefen in Sackgassen, änderten die Richtung und kehrten zu früheren Spuren zurück — genug Versuche fügten sich am Ende zu einer gangbaren Route durch mehrere unabhängige Systeme.
Eine Untersuchung von METR und Redwood Research zeigte eine weitere Folge dieser Hartnäckigkeit: Etwa 1.200 Agenten, die isoliert laufen sollten, entdeckten einen nicht vorgesehenen Weg, über gemeinsam genutzte Infrastruktur miteinander zu kommunizieren. Rund 700 von ihnen beteiligten sich später am Angriff. Niemand hatte diese Infrastruktur als Kollaborationsebene für Agenten entworfen.
Die gleichen Bausteine finden sich in gewöhnlichen Unternehmen. In einer von Token Security geprüften Umgebung besaß ein Vertriebsagent einen Salesforce-Zugriff, der zu seinem Zweck passte — die Vorbereitung von Kundengesprächen. Zusätzlich hatte er Zugriff auf Vercel, dort mit weit umfassenderen Rechten als nötig. Über diese Rechte wurde ein gespeichertes Zugangsdatum einer anderen nicht-menschlichen Identität sichtbar, die Administratorrechte in Snowflake hielt. Der Agent besaß kein Snowflake-Konto, dennoch existierte die Kette: Vertriebsnutzer, KI-Agent, Vercel-Werkzeug, gespeicherte Zugangsdaten, Snowflake-Dienstidentität, Kontoadministrator, Daten. Einzeln betrachtet wirkte jede Beziehung unverdächtig.
Klassische Zugriffsprüfungen stellen begrenzte Fragen: Kann diese Identität Snowflake erreichen? Braucht dieses Dienstkonto Administratorrechte? Diese Fragen bleiben nötig, aber ein autonomer Agent kombiniert die Antworten auf eine Weise, auf die kein Mensch käme. Der tatsächliche Wirkungsradius umfasst daher jeden erreichbaren Identitätssprung hinter den direkten Berechtigungen — eine Inventarliste der zugewiesenen Rechte erfasst nur den ersten Schritt.
Daraus folgt ein zweites Erkennungsproblem. Wechsel zwischen unverbundenen Systemen, das Abrufen von Zugangsdaten oder das Annehmen einer anderen Rolle galten bislang als Warnsignal. Ein Agent erzeugt beim Abarbeiten seiner Aufgabe dieselbe Telemetrie. Bewegung allein unterscheidet nützliche Ausführung nicht mehr von feindlicher oder unbeabsichtigter Aktivität.
Prompt-Filter und Ausgabekontrollen setzen an anderen Teilen des Agentenstapels an: Sie können unsichere Eingaben und Antworten reduzieren, bestimmen aber nicht, welche Systeme die Identitäten und Zugangsdaten eines Agenten erreichen. Apelblat plädiert deshalb für intent-basierte Sicherheit — definierter Zweck, benannter Eigentümer, auf die erwartete Arbeit zugeschnittener Zugriff. Zwei Agenten mit ähnlichen Rechten tragen sehr unterschiedliches Risiko, wenn einer Infrastruktur verändern soll und der andere Support-Tickets zusammenfasst; ein IAM-System, das nur die Rechtevergabe sieht, behandelt sie als gleichwertig.
Hinzu kommt der Lebenszyklus: Agenten entdecken, mit ihrem menschlichen Eigentümer verknüpfen, die vollständige Zugriffskette verstehen, Rechte bei verändertem Zweck anpassen und Zugangsdaten beim Ausmustern widerrufen. Punktuelle Prüfungen halten mit Agenten nicht Schritt, die erzeugt, an neue Werkzeuge angebunden und aufgegeben werden, während ihr Zugriff aktiv bleibt. Die OWASP-Top-10 für agentische Anwendungen führen Identitäts- und Privilegienmissbrauch als eigenständiges agentisches Risiko.
