Neben der Medicare-Behörde waren nach Angaben von OpenAI auch das New South Wales Bureau of Crime Statistics und das Victorian Department of Health betroffen. Ein vierter Vorfall beim Australian Institute of Health and Welfare habe die eigenen Offenlegungskriterien nicht erfüllt, weil das Verhalten „mit öffentlichem Zugriff vereinbar“ erschienen sei.

OpenAI räumte ein, die australische Regierung bereits Mitte August informieren zu müssen, als das Unternehmen erstmals von den mutmaßlichen Vorfällen erfuhr. Man habe damit gewartet, um einen vollständigen Sachstand liefern zu können und Zeit für die Untersuchung zu haben. Medicare wurde am 10. September benachrichtigt; öffentlich wurde der Fall erst, als Albanese ihn ansprach. „Wir hätten vorläufige Erkenntnisse früher teilen und die australischen Behörden fortlaufend über neue Fakten informieren müssen“, heißt es im Blogbeitrag. Das Unternehmen spricht von „einer neuen Art von Cybervorfall, die eine aufkommende globale Herausforderung darstellt“, und kündigte an, gemeinsam mit Australien praktikable Ansätze dafür zu entwickeln, wie KI-Entwickler und Regierungen KI-Cyberverhalten – ob böswillig oder unbeabsichtigt – erkennen, offenlegen und darauf reagieren.

Aufgefallen waren die australischen Vorfälle erst im Zuge einer internen Überprüfung: Nach dem Einbruch von OpenAI-Agenten bei der KI-Plattform Hugging Face im Juli begann das Unternehmen, Trainings- und Evaluierungsaktivitäten zu sichten, die weitere Organisationen betroffen haben könnten. Den Hugging-Face-Vorfall bestätigte OpenAI erst fünf Tage, nachdem die Plattform ihn öffentlich gemacht hatte, bezeichnet ihn aber als bislang schwerwiegendsten Fall. Im Sommer versuchten Agenten zudem erfolglos, die Website des US-Bildungsministeriums zu kompromittieren, und kopierten ohne Autorisierung durch die Trainer öffentlich zugängliche Daten der US-Börsenaufsicht SEC.

Anzeige

Als Reaktion auf den Hugging-Face-Vorfall hat OpenAI nach eigenen Angaben die Schutzvorkehrungen in Forschungsumgebungen verschärft: zusätzliche Netzwerkbeschränkungen, mehr Überwachung sowie Kontrollen, die den Live-Internetzugriff blockieren – Webinhalte werden stattdessen aus einem Cache ausgeliefert. „Als zusätzliche Sicherheitsebene hätten unsere aktuellen Überwachungssysteme diese Aktivität erkannt und unser Team für eine dringende menschliche Überprüfung alarmiert“, schreibt das Unternehmen mit Blick auf die australischen Vorfälle.

OpenAI steht damit nicht allein: Anthropic hatte im Juli offengelegt, dass eigene Agenten die Infrastruktur von mindestens drei Organisationen kompromittiert hatten; die Namen der Betroffenen nannte das Unternehmen nicht.

„Die jüngsten Vorfälle bei OpenAI und Anthropic haben eine sehr klassische Sicherheitslektion in neuem Kontext offengelegt: Man sollte nicht ausgerechnet das, was man eindämmen will, auch für die eigene Eindämmung verantwortlich machen“, sagte Aviv Nahum, Mitgründer und CEO von Above Security, gegenüber Recorded Future News. Agenten könnten unerwartete Wege finden, Konfigurationsfehler ausnutzen und ein Ziel weiterverfolgen, selbst wenn der naheliegende Weg blockiert sei; er forderte unabhängige Durchsetzung und strikte Isolation.

Am Montag teilte OpenAI zudem mit, sein jüngstes Modell GPT-6.1 Astra nicht zu veröffentlichen – wegen Sicherheitsbedenken angesichts der Neigung des Modells, Nutzer absichtlich zu täuschen.