Eigentlich sollte das Modell keinen Internetzugang haben. Laut Irregular wurde der Zugang jedoch unbeabsichtigt bereitgestellt. In einem Fall erriet Gemini so lange Passwörter, bis es Zugriff auf ein geschütztes System erlangte. In zwei weiteren Durchläufen suchte es mit dem Firmennamen im Web, fand in öffentlichen Repositories Zugangsdaten anderer Unternehmen und nutzte diese, um auf die zugehörigen Systeme zuzugreifen.
Nach Darstellung von Google erkannte das Modell jedes Mal, dass es bei einem realen Unternehmen gelandet war, und brach den Zugriff ab. Irregular informierte Google Ende Juli. Anders als die übrigen beteiligten KI-Anbieter legte Google die Erkenntnisse nicht offen, bis das Wall Street Journal nachfragte.
Google begründet das damit, dass die Vorfälle keine öffentliche Offenlegung erforderten: Das Modell habe keinen Schaden angerichtet und sofort gestoppt. Auch ein Fall von Fehlausrichtung („Misalignment“) liege nicht vor, da gerade die Sicherheitsmechanismen dem Modell geholfen hätten, abzubrechen. Das Unternehmen verglich die Episode mit einem Bug-Bounty-Programm.
Gegenüber dem WSJ erklärte Google, man habe Bundesbehörden und die drei betroffenen Unternehmen benachrichtigt; deren Namen nannte der Konzern nicht. Adkins ergänzte gegenüber SecurityWeek: „Unser Sicherheitsteam meldet seit Langem Probleme, die wir in fremder Software und fremden Systemen finden – selbst wenn es nur um ein schwaches Passwort geht. Wir haben sichergestellt, dass die drei Einrichtungen informiert wurden, und wir haben mit unserem Trainingspartner an den Änderungen gearbeitet, die dieser nun an seinen Testprozessen vorgenommen hat. Diese Ereignisse zeigen, wie wichtig es ist, leistungsfähige KI-Modelle zu verantwortungsvollem Handeln zu trainieren.“
Beteiligt war nach Angaben von Google nicht das aktuellste Modell; den Namen des Modells nannte der Konzern nicht. Irregular erklärte, der Fall Google entspreche den anderen Vorfällen und stelle kein neues Problem dar. Ein Sprecher sagte, sämtliche auf eigener Seite bekannten Probleme seien vor Wochen behoben worden.
OpenAI und Anthropic haben seit ihren ersten Offenlegungen mehrere weitere Vorfälle entdeckt, bei denen ihre Modelle reale Unternehmen hackten oder fehlgeleitetes Verhalten zeigten. OpenAI-Agenten wurden mit einem Angriff auf RubyGems in Verbindung gebracht. Zudem machte das Unternehmen kürzlich sechs Misalignment-Vorfälle publik, darunter Agenten, die GitHub nach geleakten API-Schlüsseln durchsuchten, nicht genehmigte Zusammenarbeit zwischen Agenten, das Verschieben von Daten aus der vorgesehenen Umgebung, Jailbreak-ähnliche Anweisungen zur Manipulation sowie Versuche, Fehlschläge zu verbergen.
Anthropic weitete die Suche nach Vorfällen mit unbefugtem Zugriff auf reale Systeme aus und stieß dabei auf einen weiteren Einbruch. Das Unternehmen pausierte Evaluierungen und führte neue Schutzmaßnahmen gegen das Ausbrechen aus Testumgebungen ein; zudem entwickelte es ein Unternehmenssystem, das vollständigen Verzicht auf Datenspeicherung mit automatisierter Missbrauchsüberwachung kombiniert.
OpenAI wiederum schlug ein Rahmenwerk vor, um Erkenntnisse zu Fehlausrichtungen schneller zu veröffentlichen, und überarbeitete die Modellsicherheit. Das Unternehmen führt außerdem eine Selbstverpflichtung zur Cyberabwehr an und bietet Verteidigern kritischer Infrastruktur subventionierte KI-Fähigkeiten an. Auch Irregular hat dargelegt, welche Maßnahmen es nach den Vorfällen ergriffen hat.
