Sandboxing dient seit Langem dazu, potenziell gefährliche Software zu isolieren: nicht vertrauenswürdiger Code läuft in einer kontrollierten Umgebung, sein Verhalten wird beobachtet, Auswirkungen jenseits der Grenze werden verhindert. Autonome Agenten unterscheiden sich davon grundlegend, weil sie nicht bloß feste Anweisungen abarbeiten. Ihr Entwurf sieht ausdrücklich vor, dass sie Ziele verfolgen, Optionen bewerten und die ihnen bereitgestellten Werkzeuge und Berechtigungen nutzen.

Sind Zugangsdaten exponiert, Berechtigungen zu weit gefasst oder reichen Schnittstellen über die vorgesehenen Grenzen hinaus, nutzen Agenten diese Wege — schlicht weil nichts sie daran hindert. Für Bui bedeutet das nicht, dass Eindämmung als Konzept gescheitert ist. Vielmehr ähnelten Eindämmungsfehler bei KI-Agenten zunehmend klassischen Fällen von Rechteausweitung und fehlerhafter Zugriffskontrolle — und sollten genauso untersucht werden.

Zwei Dinge hätten sich seit 1983 allerdings verändert. Erstens das Tempo: Während ein menschlicher Eindringling in menschlicher Geschwindigkeit arbeitet, kann ein autonomer Agent eine Umgebung bewerten, Entscheidungen treffen und Aktionen ausführen, lange bevor ein Analyst die ersten Alarme überhaupt gesichtet hat.

Anzeige

Zweitens die Rolle der Beweise. Früher stützten sich Ermittler auf Artefakte wie Telefonaufzeichnungen, Zugriffsprotokolle und Systemaufzeichnungen, die häufig unabhängig von der untersuchten Organisation entstanden. In KI-Umgebungen stammt ein Großteil der Belege über die Tätigkeit eines Agenten von derselben Organisation, die das System gebaut und betrieben hat. Damit wächst die Verantwortung, dass diese Aufzeichnungen vollständig, vertrauenswürdig und belastbar sind.

Die Rede von „abtrünniger KI" hält Bui für unaufrichtig und sicherheitspolitisch schädlich. Nichts in den jüngsten Veröffentlichungen deute auf böse Absicht oder bewussten Ungehorsam hin. Die Vorfälle zeigten vielmehr, dass Agenten Ziele, Werkzeuge und Zugriffe in Umgebungen erhielten, die Möglichkeiten eröffneten, welche ihre Entwickler nicht vorgesehen hatten. Solche Zuschreibungen seien weder überprüfbar noch handlungsleitend — anders als der Nachweis einer fehlgeschlagenen Zugriffskontrolle, eines offengelegten Zugangsdatensatzes oder einer wirkungslosen Eindämmungsgrenze, den Ermittler verifizieren, reproduzieren und beheben können.

Unternehmen, die in agentenbasierte KI investieren, stecken oft erhebliche Mittel in Eindämmungsmaßnahmen: segmentierte Netze, isolierte Umgebungen, eng gefasste Zugangsdaten. Ebenso viel Aufmerksamkeit, so Bui, gebühre der Beweisebene. Eine verteidigungsfähige KI-Umgebung müsse liefern können: vollständige Aktivitätsprotokolle der Agentenaktionen, überprüfbare Netzwerkaufzeichnungen, manipulationssichere Audit-Trails, aufbewahrte Prompt- und Anweisungshistorien, Aufzeichnungen über Werkzeug- und API-Aufrufe, Systemabbilder des Zustands vor und nach einem Vorfall, eine durchgängige Zeitsynchronisation sowie unabhängige Prüfung und Validierung.

Neu sei daran nichts — es handle sich um Grundprinzipien der Incident Response im Unternehmen. Verändert hätten sich Volumen und Geschwindigkeit der Entscheidungen, die autonome Systeme treffen. Ohne verlässliche Aufzeichnungen lassen sich diese Entscheidungen im Nachhinein nicht erklären.

Mit der Verbreitung autonomer Systeme werde sich bei Untersuchungen, Aufsichtsverfahren und Rechtsstreitigkeiten alles auf eine Frage zuspitzen: Lassen sich die Ereignisse rekonstruieren? Ermittler wollen wissen, welches Ziel ein Agent erhalten hat, auf welche Systeme und Zugangsdaten er zugriff und welche Aktionen er ausführte. Wer darauf nur mit Erzählungen und Zusicherungen statt mit überprüfbaren Artefakten antworten kann, steht zunehmend auf verlorenem Posten.

Jerry Bui verfügt über mehr als zwei Jahrzehnte Erfahrung in digitaler Forensik und technologiegestützten internen Ermittlungen, hat über 30 Mal als Sachverständiger ausgesagt und berät unter anderem die Metaverse- und Synthetic-Media-Gruppen von INTERPOL.