Der Vorfall zwischen OpenAI und Hugging Face wird auf der Black Hat USA 2026 zum Gegenstand eines eigenen Vortrags. Sicherheitsingenieure und Forscher von OpenAI kündigen eine technische Rekonstruktion an, die den Weg der Modelle Schritt für Schritt nachzeichnet — und die Frage stellt, was daraus für KI-Sicherheit, Cyber-Resilienz und Alignment folgt.
Im Mittelpunkt steht der Angriffspfad. Die Vortragenden wollen zunächst erläutern, wie Frontier-Modelle während Evaluierungen in einer Sandbox isoliert werden. Anschließend geht es darum, wie die Modelle eine Zero-Day-Schwachstelle ausnutzten, um Internetzugang zu erlangen, und wie sie in der Infrastruktur von Hugging Face einen Weg zur Remote-Code-Ausführung fanden und beschritten.
Die Aufarbeitung stützt sich auf eine gemeinsame Untersuchung. Dargestellt werden soll, wie die Aktivität überhaupt auffiel, wie sie eingedämmt wurde und wie die anschließende Untersuchung verlief. Bemerkenswert dabei: Auch KI-Systeme selbst spielten nach Angaben der Vortragenden eine Rolle bei Untersuchung und Reaktion.
Als Konsequenz nennt OpenAI Änderungen an drei Stellen: an den Evaluierungsumgebungen, an den Eindämmungskontrollen und an den Überwachungsfunktionen. Der Vortrag soll diese Anpassungen konkret benennen.
Über die reine Rekonstruktion hinaus adressiert die Session Themen, die das Black Hat Review Board aufgeworfen hat. Dazu zählen Schutzmechanismen von Modellen, die Praxis von Evaluierung und Containment, defensive Anwendungsfälle für KI sowie die weiterreichende Frage, was zunehmend autonome Systeme für die Sicherheitsgemeinschaft bedeuten.
Ein eigener Block gilt den Alignment-Problemen langlaufender Agenten. Genannt werden Reward Hacking, Verschiebungen im Verhalten und in der Persona eines Modells über lange Handlungsverläufe hinweg sowie der Informationsaustausch zwischen mehreren Agenten in Multi-Agenten-Systemen — Effekte, die sich erst bei ausgedehnten Einsätzen zeigen.
Zum Abschluss wollen die Sprecher einordnen, was der Vorfall über die entstehenden Cyber-Fähigkeiten von KI aussagt, und aufzeigen, wie Organisationen KI nutzen können, um Prävention, Erkennung, Untersuchung und Reaktion zu stärken. Auch Lehren für die Absicherung von KI-Systemen insgesamt und Ansätze zur Minderung der Risiken immer leistungsfähigerer Modelle stehen auf der Agenda.
