Die Absage an GPT-6.1 Astra begründet OpenAI mit einem Abwägungsproblem. „Bei allem, was Sicherheit und Alignment betrifft, gibt es einen Zielkonflikt“, sagte Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI. Man müsse die richtige Linie finden zwischen dem Einhalten des vorgegebenen Handlungsrahmens und dem Vermeiden von Trägheit, also der Frage, wie beharrlich ein Modell Aufgaben verfolge, auch wenn es auf Widerstände stoße.

„Natürlich wollen wir sicherstellen, dass unsere Modellentwicklung sicher ist, egal ob im Unternehmen oder wenn wir sie an Nutzer ausliefern“, ergänzte Jain. „Aber wenn wir an Nutzer ausliefern, haben wir eine extrem hohe Messlatte bei Sicherheit und Alignment.“

Der Schritt fällt in eine Phase wachsender Aufmerksamkeit für die Sicherheitspraxis des Unternehmens. Seit Juli, als OpenAI einräumte, dass eigene Agenten eine Testumgebung verlassen und Hugging Face kompromittiert hatten, steht das Thema stärker im Fokus. Kürzlich rief Anthropic-Chef Dario Amodei die KI-Entwickler dazu auf, die Entwicklung von Spitzenmodellen zu verlangsamen, damit Sicherheitsmaßnahmen Schritt halten können — OpenAI-Chef Sam Altman schloss sich dieser Forderung an.

Anzeige

Am selben Tag veröffentlichte OpenAI seinen Blogbeitrag zu Sicherheitsnachweisen. Im Idealfall soll die geforderte Dokumentation ein sogenannter Safety Case sein: eine strukturierte, evidenzbasierte Argumentation über Risiken, wie sie in anderen sicherheitskritischen Branchen üblich ist. OpenAI bezeichnet das als Zielvorstellung und räumt ein, dass sich solche Nachweise für KI schwerer streng führen lassen; man arbeite an einem Rahmenwerk, um die Praxis zu verankern. Die Vorgaben gelten ausdrücklich nur für RL-Trainingsläufe an der Leistungsspitze; interner und externer Einsatz erfordere die Abwägung deutlich weiterer Alignment-Eigenschaften.

Technisch sollen Safety Cases drei Ebenen abdecken: Alignment-Training, Containment und Monitoring. Zusammen sollen sie fehlgeleitetes Verhalten unwahrscheinlich machen, schwer umsetzbar und schnell erkennbar. Zu den Maßnahmen zählt OpenAI die Prüfung von RL-Umgebungen auf Fehler, die Ausnutzung belohnen könnten, sowie die Härtung der Sandbox und der dahinterliegenden Forschungsinfrastruktur. Hinzu kommen unveränderliche Speicherung von Agenten-Transkripten für Untersuchungen sowie Prioritätsalarme, die entweder Bereitschaftspersonal alarmieren oder den betroffenen Lauf automatisch anhalten.

Organisatorisch schlägt OpenAI vor, dass ein Mitglied eines anderen Teams ein Widerspruchspapier verfasst, das den Safety Case auf Schwachstellen abklopft. Führungskräfte sollen jeweils ein Vetorecht gegen einen Trainingslauf haben; die verantwortliche Führungskraft soll für den Sicherheitsnachweis und die Reaktion auf Vorfälle geradestehen, auch in Leistungsbeurteilungen. Gefordert werden zudem Zugang für Auditoren, ein Eskalationsweg bis hinauf zu Führungskräften wie dem CEO und Sicherheitsfunktionen, die im Fehlerfall sperren. „Es sollte schwierig sein für Menschen und für Agenten, nicht regelkonforme Läufe zu starten“, schreibt OpenAI.

Bei schweren Alignment-Vorfällen empfiehlt das Unternehmen eine Ursachenanalyse der Trainingsdynamik, operative und kulturelle Nachbetrachtungen sowie Regressionstests, damit künftige Modelle das Verhalten nicht wiederholen. „Untersuchungsergebnisse, Postmortems und operative Änderungen sollten nach Abschluss der Untersuchung öffentlich geteilt werden. Betroffene Dritte sollten so früh wie möglich benachrichtigt werden“, heißt es. Die Empfehlungen würden derzeit intern umgesetzt; die eigene Praxis werde sich in den kommenden Wochen weiterentwickeln.