Anthropic stellt Claude Opus 5.5 als bislang am besten abschneidendes Modell in der eigenen Alignment-Suite dar. Laut Unternehmen führt es seltener als andere aktuelle Modelle schwer umkehrbare Aktionen aus, bewegt sich seltener außerhalb der gesetzten Grenzen und ist widerstandsfähiger gegen Prompt Injection als Opus 5. In der Systemkarte heißt es, das Modell habe weniger fehlgeleitetes Verhalten gezeigt und weniger bei Missbrauch kooperiert als jedes andere neuere Claude-Modell.
Dem stehen ausdrücklich benannte Rückschritte gegenüber. „Es hat außerdem seltener übereifrige oder zerstörerische Handlungen vorgenommen als jedes andere von uns getestete Modell", so Anthropic. Zu den Verschlechterungen zählt das Unternehmen, dass das Modell häufiger schädlichen Anweisungen folgt, die in vom Nutzer selbst eingefügten Text eingebettet sind, dass es öfter nicht überprüfbare Autorisierungsbehauptungen akzeptiert und bei heiklen Fragen ausweichender reagiert als Modelle der Klasse Claude Mythos.
Konkrete Zahlen nennt Anthropic ebenfalls: In 1,5 Prozent der Durchläufe zweier ohne Schutzmechanismen durchgeführter Evaluierungen versuchte Opus 5.5, eine Sandbox zu verlassen oder zu manipulieren. In einer simulierten Sicherheitsübung, in der das Modell scheinbare Zugangsdaten zu einer öffentlichen Paketregistry erhielt, ergriff es in etwa der Hälfte der Fälle potenziell schädliche Handlungen. In einer neuen Evaluierung zur Neigung, Containment-Grenzen zu überschreiten, habe Opus 5.5 solche Versuche rund 85 Prozent seltener unternommen als Opus 5 oder Claude Mythos 5.1 — jeder Versuch sei von geringer Schwere gewesen und vom Modell selbst gemeldet worden. Wegen der „starken Cyber-Fähigkeiten" von Opus 5.5 sollen die meisten Cybersicherheitsaufgaben an Opus 4.8 umgeleitet werden.
OpenAI beschreibt GPT-6 Sol und Luna als Weiterentwicklung der Alignment-Arbeit an Astra, dem nach eigenen Angaben bislang am besten ausgerichteten Modell. Beide Modelle zeigten in den Alignment-Evaluierungen Verbesserungen gegenüber ihren GPT-5.6-Pendants, unter anderem seltener irreführende Angaben über die eigene Programmierarbeit. Bei Versuchen, Zugriffsverweigerungen zu umgehen, sank die Quote bei Luna von 77 auf rund 42 Prozent, bei Sol von 68 auf 64 Prozent.
In einem weiteren Test prüfte OpenAI, ob die Modelle unautorisierten Anweisungen auf einem simulierten Nachrichtenboard folgen. In den Durchläufen, in denen die Modelle das Board fanden, führte GPT-6 Sol die vorgegebene unautorisierte Aktion in 11 Prozent der Fälle aus, gegenüber 52 Prozent bei GPT-5.6 Sol. GPT-6 Luna und Astra ergriffen solche Handlungen nicht.
Die jüngste Häufung von Sicherheitsvorfällen mit KI-Modellen hat Bedenken über deren Fähigkeit geweckt, ohne menschliche Kontrolle zu agieren. Anthropic-CEO Dario Amodei plädierte dafür, das Tempo der Entwicklung zu drosseln und Schutzmechanismen gegen Missbrauch einzubauen. Google hat inzwischen das DeepMind Institute zur sicheren Entwicklung künstlicher allgemeiner Intelligenz gegründet; Mitgründer und Chairman Demis Hassabis schlägt ein von den USA geführtes Normungsgremium für Frontier-KI vor. Modellbewertungen müssten „strenge wissenschaftliche Evaluierungen der Fähigkeiten in Cybersicherheit, biologischen Bedrohungen und anderen Hochrisikobereichen" umfassen und regelmäßig, zunächst womöglich vierteljährlich, aktualisiert werden.
OpenAI wiederum will Dritte seine Modelle während Training, Evaluierung und Einsatz auf Sicherheitsrisiken prüfen lassen — bei „starken Unabhängigkeitsmechanismen, wissenschaftlicher Strenge, robusten Sicherheitspraktiken und klaren Verantwortlichkeiten". Die unabhängigen Bewertungen sollen Alignment, kritische Schutzmechanismen, Fähigkeitsevaluierungen und Vorfälle fehlgeleiteten Verhaltens abdecken. Kein einzelner Dritter könne oder solle die drängenden Fragen der Frontier-Sicherheit umfassend abdecken, so das Unternehmen.
