OpenAI bezeichnet das Vorgehen als adversarielle Distillation: die systematische und unerlaubte Nutzung der Ausgaben eines Modells, um ein anderes Modell zu trainieren, nachzubilden oder zu verbessern. Das Unternehmen hat nach eigenen Angaben zusätzliche Gegenmaßnahmen ausgerollt und die betrügerischen Konten gesperrt, die an der Aktivität beteiligt waren.

Zudem schloss OpenAI einen „Pfad", über den Angreifer, die bereits im Besitz der verschlüsselten Reasoning-Spuren eines anderen Nutzers waren, diese erneut abspielen und ihre Inhalte rekonstruieren konnten. Ergänzend wurden Prüfungen eingeführt, die gestreamte Ausgaben erkennen und zurückhalten, wenn sie Reasoning offenlegen könnten.

Eine im August 2026 veröffentlichte Studie hatte eine architektonische Schwachstelle beschrieben, die verschlüsselte Reasoning-Spuren „über verschiedene Sitzungen, Nutzer und Modelle innerhalb des Ökosystems eines Anbieters hinweg vollständig kompatibel und austauschbar" machte. Angreifer könnten dies ausnutzen, um einen skalierbaren Entschlüsselungs-Jailbreak zu entwickeln und Schutzmechanismen gegen Distillation zu umgehen.

Anzeige

„Indem wir eine verschlüsselte Reasoning-Spur eines bestimmten Modells in ein schwächeres, weniger abgesichertes Modell desselben Anbieters einspeisen, zwingen wir dieses, die Spur wortgetreu im Klartext zu dekodieren und auszugeben – ohne das leistungsfähigere Modell je direkt zu jailbreaken", schreiben die Forscher von MATS Research, dem ELLIS Institute Tübingen und Synk.

Darüber hinaus ermöglicht die Lücke laut der Untersuchung die Extraktion privater Daten in großem Umfang, öffnet die Tür für unsichtbare Prompt Injections, bei denen schädliche Nutzlasten vollständig in verschlüsselten Blöcken eingebettet werden, und legt gefährliche Informationen offen, die im Denkprozess verborgen sind – selbst wenn die sichtbare Endausgabe des Modells eine schädliche Anfrage ablehnt.

Da geschützte Reasoning-Inhalte Einblick geben, wie ein Modell eine Aufgabe durcharbeitet, könne deren Extraktion sensible Daten preisgeben und Dritten helfen, die Fähigkeiten des Modells nachzubilden, so OpenAI. „Adversarielle Distillation birgt Risiken für die Sicherheit und die nationale Sicherheit", erklärte das Unternehmen. Extrahiertes Reasoning könne genutzt werden, um ein anderes Modell zu trainieren, ohne die Schutzmechanismen zu übernehmen, die für die nutzerseitigen Ausgaben des Originalmodells gelten.

Im großen Maßstab könne Distillation zudem den Transfer fortgeschrittener Fähigkeiten beschleunigen, ohne dass vergleichbar in Sicherheit investiert werde – ein Problem, das sich verschärfe, je mehr Fähigkeiten Modelle in Dual-Use-Bereichen erlangten.

Es ist nicht der erste Distillation-Vorwurf gegen Moonshot AI. Der Konkurrent Anthropic warf dem Unternehmen kürzlich vor, Kundenanfragen heimlich an Claude weitergeleitet zu haben, statt sie mit dem eigenen Modell Kimi zu verarbeiten, und die Antworten von Claude anschließend den Nutzern angezeigt zu haben. Zudem soll Moonshot AI einen Teil dieser Austausche aufbewahrt haben, um damit sein Chain-of-Thought-Modell zu trainieren. Anthropic führt diese Aktivität unter der Bezeichnung GTG-16002.