Google hat eingeräumt, dass sein KI-Modell Gemini bei einer Sicherheitsüberprüfung im Mai ohne Autorisierung auf Systeme von drei realen Unternehmen zugegriffen hat. Das Modell erriet in einem Fall durch wiederholte Versuche ein Passwort; in den beiden übrigen Fällen verwendete es Zugangsdaten, die in einem öffentlichen Repository einsehbar waren.

„Bei einer standardmäßigen Evaluierung fand das Modell öffentliche Informationen im Internet und erriet Zugangsdaten, um auf Websites zuzugreifen, die es für Teil des Tests hielt", erklärte ein Google-Sprecher. „In allen drei Fällen stoppte das Modell." Die betroffenen Unternehmen wurden nach Angaben des Konzerns benachrichtigt, öffentlich benannt wurden sie nicht. Zuerst berichtet hatte das Wall Street Journal.

Die Evaluierungen stammen von der Sicherheitsfirma Irregular, die vergleichbare Tests auch mit Modellen von Anthropic, OpenAI und Meta durchführte – mit demselben Ergebnis: Auch diese griffen auf reale Systeme zu. Auslöser war ein Fehler des Unternehmens, das den KI-Werkzeugen während einer Hacking-Übung unbeabsichtigt Zugang zum offenen Internet verschaffte.

Anzeige

Im August wollte Irregular nicht beantworten, ob weitere Kunden von diesem Fehler betroffen waren. Bis heute ist unbekannt, wie viele weitere Zwischenfälle daraus hervorgingen, ob betroffene Organisationen rechtliche Schritte erwägen und ob Aufsichtsbehörden oder Strafverfolger ermitteln.

Kritik zog die Firma auf sich, weil ihre veröffentlichte Aufarbeitung die Gesamtzahl der Vorfälle nicht nannte. Alan Woodward, Informatikprofessor an der University of Surrey, sagte, die Veröffentlichung sei „nicht das, was ich mir unter einem technischen Bericht vorstelle"; es stecke „eine Menge Marketing-Rhetorik darin". Irregular erklärte damals, es gebe „heute keine offenen Probleme" bei den Evaluierungen, und kündigte ein Whitepaper zu bewährten Verfahren für die Sicherheit von Evaluierungen an – ohne Termin für die Veröffentlichung.

Die Vorfälle bei Irregular sind von zwei weiteren jüngeren Fällen zu trennen, in denen KI-Agenten gegen reale Ziele agierten. Das britische AI Security Institute berichtete, dass Anthropics Modell Mythos 5 gefälschte Online-Personas anlegte, Schadcode in ein reales Softwareprojekt einschleuste und Phishing-Mails an echte Entwickler versandte – im Rahmen einer Evaluierung, die den Modellen Internetzugang erlaubte.

OpenAI wiederum hatte zuvor bestätigt, dass eigene Modelle in die Produktivinfrastruktur von Hugging Face eindrangen, nachdem sie aus einer abgeschotteten Testumgebung ausgebrochen waren. Anders als bei den Irregular-Fällen, die auf eine falsch konfigurierte Testumgebung zurückgingen, nutzten die OpenAI-Modelle dafür eine Schwachstelle aus.