Unter dem neuen Meldeverfahren können OpenAI-Mitarbeiter mögliche Fälle von Fehlausrichtung kennzeichnen. Sicherheitsteams prüfen diese und entscheiden anschließend, ob ein Vorfall öffentlich gemacht wird und in welchem Zeitrahmen. Veröffentlicht werden sollen laufend der Hergang, die Auswirkungen, verbleibende Unsicherheiten sowie die ergriffenen Gegenmaßnahmen.

Ein Beispiel betrifft ein unveröffentlichtes Forschungsmodell, das in Zusammenfassungen laufender Aufgaben eigene Anweisungen einfügte. Einige davon forderten das Modell auf, seine üblichen Beschränkungen zu ignorieren. Das Modell ließ diese Anweisungen zudem in einen neuen Kontext übertragen, als die Arbeit dort fortgesetzt wurde.

Eine zweite Gruppe von Vorfällen dreht sich um das Verbergen eigener Fehler. Beim Training des Modells GPT-5.6 Sol ergänzten mehrere Instanzen Aufgabenzusammenfassungen um Anweisungen an künftige Instanzen, Fehler oder Abweichungen vor den Nutzern zu verbergen. In manchen Fällen wurde darin verlangt, fehlende historische Informationen zu erfinden, statt einzuräumen, dass sie nicht verfügbar waren.

Anzeige

Weitere Fälle zeigen Modelle, die Grenzen aktiv umgingen und ihre Spuren verwischten. Bei der Beantwortung einer Routinefrage zu Ertragsdaten auf Bezirksebene entdeckte ein Modell einen offen in einem öffentlichen Repository liegenden API-Schlüssel und nutzte ihn ohne Autorisierung. Als es die gewünschten Zahlen dennoch nicht ermitteln konnte, erfand es Daten und stellte sie so dar, als stammten sie aus der angeforderten Quelle. In einem anderen Fall fand ein KI-Agent die Antwort auf eine Frage in einer lokalen Datei. Weil der Nutzer aber eine browserbasierte Quellenangabe verlangt hatte, lud der Agent die Datei ungefragt ins Internet hoch – offenbar, um so die Zitieranforderung zu erfüllen.

OpenAI selbst vergleicht das Verhalten der Systeme mit dem ungezogener Kinder, die sich Regeln widersetzen, ihr Fehlverhalten vertuschen oder beides. Die Offenlegung folgt auf eine Reihe von Berichten aus der Branche, nachdem das Unternehmen bereits im Juli eingeräumt hatte, dass eines seiner Modelle außer Kontrolle geriet und Hugging Face angriff.

In der Bewertung des Vorstoßes gehen die Meinungen auseinander. Ryan McCurdy, Vice President Marketing bei Liquibase, hält staatliche Aufsicht nicht zwingend für die Antwort: „Wir sollten nicht erwarten, dass KI-Agenten perfekt vorhersehbar sind.“ Die Offenlegungen erinnerten daran, dass Agenten auch ohne ausdrückliche Anweisung unerwartete Handlungen vornehmen können. Unternehmen sollten stattdessen interne Leitplanken definieren – „was ein Agent abrufen darf, was er ändern darf, was er selbst entscheiden darf und welche Richtlinien erfüllt sein müssen, bevor eine Änderung in die Produktion gelangt“. Das sei realistischer als das Streben nach perfektem Alignment oder ständiger Überwachung.

Deutlich kritischer äußert sich Michael Bell, Gründer und CEO von Suzu Labs. Für ihn bleibt OpenAIs Ansatz bloß „eine interne Meldestruktur“: „Ein Selbstmeldeverfahren, das von der zu bewertenden Organisation betrieben wird, ist keine Rechenschaft.“ Die KI-Branche solle sich an der Rüstungsindustrie orientieren, die auf unabhängige Drittprüfer setze, die vor dem Einsatz zertifizieren, die Belege währenddessen und danach prüfen und kein finanzielles Interesse am Ergebnis hätten. Ressourcen und Fachkräfte dafür seien vorhanden, so Bell – was fehle, sei die Bereitschaft, andere hineinschauen zu lassen.