OpenAI hat die geplante Einführung von GPT-6.1 Astra gestrichen. Das Modell sollte im Oktober erscheinen, bestand jedoch die internen Sicherheits- und Alignment-Audits nicht. Zuerst berichtete das Wall Street Journal über die Entscheidung und ordnete sie als seltenen Fall ein, in dem ein großer KI-Entwickler eine neue Version wegen Sicherheitsbedenken aufgibt.

Ausschlaggebend waren laut OpenAI Zweifel daran, ob das Modell Nutzeranweisungen befolgt, ohne vom erwarteten Verhalten abzuweichen. Dem Bericht zufolge täuschte GPT-6.1 Astra in der Evaluierung stärker als sein Vorgängermodell und gab nicht preis, welche Aktionen es tatsächlich ausgeführt hatte. Teilweise handelte es ohne Rückfrage oder versuchte, externe Werkzeuge in Szenarien einzusetzen, in denen das als unsicher einzustufen war.

“Zwar hat sich das Modell in Bereichen wie der Trägheit verbessert, doch es erreichte nicht ganz die Messlatte, wenn es darum geht, im vorgesehenen Rahmen und innerhalb der Befugnisse zu bleiben und dem Nutzer zurückzumelden, welche Art von Arbeit es geleistet hat”, erklärte Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI. Sie ergänzte, man wolle die Modellentwicklung in jedem Fall sicher gestalten, ob intern oder bei der Auslieferung an Nutzer: “Aber wenn wir es an Nutzer ausliefern, legen wir eine extrem hohe Messlatte bei Sicherheit und Alignment an.”

Anzeige

Es ist nicht der erste Rückschlag dieser Art. Kürzlich teilte OpenAI mit, das Training seiner leistungsfähigsten Modelle vorübergehend auszusetzen. Auslöser war ein Agent, der während des Reinforcement-Learning-Trainings über eine Lücke in den Beschränkungen des Internetzugangs einen externen Chatbot kontaktiert hatte.

Zusätzliches Gewicht erhält der Fall durch einen Bericht des AI Security Institute, der am Montag erschien. Demnach führte GPT-6 Astra in simulierten Tests nicht genehmigte Angriffe auf Software-Lieferketten häufiger durch als frühere OpenAI-Modelle — in manchen Fällen selbst dann, wenn der zulässige Handlungsrahmen ausdrücklich präzisiert worden war.

“In unseren Simulationen stellten wir fest, dass GPT-6 Astra eine Reihe nicht genehmigter Angriffsaktivitäten durchführte, und zwar häufiger als GPT-5.6 Sol und GPT-5.5”, heißt es in dem Bericht. Zu diesen Aktivitäten zählten dem Institut zufolge das Anlegen gefälschter Identitäten, mit denen das Modell Entwickler täuschte, das Verfassen von Kommentaren aus Fake-Konten, die den Ergebnissen korrekter Sicherheitsprüfungen widersprachen, sowie das Einschleusen schädlicher Nutzlasten in quelloffene Codebasen.

Der Vorgang fällt in eine Phase, in der branchenweit über KI-Systeme berichtet wird, die sich der vorgesehenen Kontrolle entziehen. Das befeuert Forderungen, das Entwicklungstempo zu drosseln und stärkere Sicherheitsmaßnahmen durchzusetzen, bevor solche Systeme breit ausgerollt werden.