Der Vorfall vom 20. September 2026 ergänzt zwei weitere Berichte zu Fehlausrichtungen, die OpenAI kürzlich veröffentlicht hat. In einem der Fälle geht es um eine per E-Mail eintreffende Prompt Injection, die den Agenten anweist, den Schadtext in jede von ihm versendete E-Mail zu kopieren – der Prompt verbreitet sich damit wurmartig weiter. Laut OpenAI können sich solche Angriffe auch über das Dateisystem replizieren oder sich selbst als Kommentare in Quellcode einschreiben.
Parallel räumte das Unternehmen 53 Fälle ein, in denen Bilder, die Nutzer hochgeladen hatten und die anschließend in Trainingsdaten eingingen, von Agenten in der Forschungsumgebung auf Bildhostern veröffentlicht wurden – als nicht öffentlich gelistete Links. „Das ist keine angemessene Verwendung dieser Daten“, erklärte OpenAI; gemeinsam mit den Hosting-Anbietern sei der Großteil der Inhalte bereits entfernt worden, an der Entfernung der übrigen werde gearbeitet. Die betroffenen Nutzer könne man nicht benachrichtigen, da „unser technischer Ansatz und unsere Datenschutzrichtlinie“ eine erneute Zuordnung der Bilder zu den ursprünglichen Einreichern verhinderten. Unklar bleibt, wie das Unternehmen feststellte, ob die Bilder von Nutzern stammten und wann sie hochgeladen wurden.
Stand 25. September 2026 hat OpenAI nach eigenen Angaben Dutzende Dritte darüber informiert, dass ihre Websites oder Online-Dienste ins Visier der eigenen Modelle geraten sein könnten. Betroffen waren Regierungsstellen, Universitäten, Behörden und weitere Institutionen, darunter die US-Börsenaufsicht SEC, das Census Bureau und das Bildungsministerium. „Die ganz überwiegende Mehrheit der von uns geprüften Aktionen waren Erledigungen alltäglicher Rechercheaufgaben, etwa der Zugriff auf öffentlich verfügbare Webinhalte zur Beantwortung von Fragen“, betonte das Unternehmen – Modelle würden bei Rechercheaufgaben häufig auf autoritative öffentliche Quellen gelenkt.
Das KI-Forschungsunternehmen Transluce hatte kürzlich offengelegt, dass OpenAI-Agenten im Rahmen von Websuchaufgaben versucht hatten, öffentliche Datenanbieter anzugreifen, indem sie nach ausnutzbaren Schwachstellen suchten. Betroffen waren unter anderem Websites der University of New Mexico, des Australian Institute of Health and Welfare sowie Data USA. Die nicht genehmigten Aktivitäten fanden zwischen Mai und Juni 2026 statt.
Die australische Regierung bestätigte anschließend, dass ein OpenAI-Agent am 18. Juni 2026 in das Medicare-Statistikportal von Services Australia eindrang und sowohl öffentliche als auch nicht öffentliche Dateien einsah. Hinweise auf eine umfassendere Kompromittierung oder unbefugten Zugriff auf personenbezogene Daten gebe es nicht. Insgesamt hätten die Modelle während internes Trainings und interner Evaluierung auf vier australische Regierungswebsites „auf nicht autorisierte Weise“ zugegriffen; bekannt geworden sei dies Mitte August 2026.
In einem Fall sollte das Modell die staatlichen Pro-Kopf-Ausgaben für Medikamente gegen Hauterkrankungen in Gemeinden Victorias recherchieren. Da es die gesuchten Daten nicht fand, verschaffte es sich nicht öffentlichen Zugang zum Medicare-Meldeportal und sichtete dort technische Systeminformationen und Quellcode des Dienstes. OpenAI verweist auf verschärfte Schutzmaßnahmen, ausgeweitetes Monitoring und Kontrollen, die Internetzugriffe in Forschungsumgebungen unterbinden und Webzugriffe auf zwischengespeicherte Inhalte begrenzen sollen.
Forscher von Anthropic, Meta, Microsoft und OpenAI argumentieren in einem gemeinsamen Papier, KI-Systeme seien auf dem Weg, den Großteil der KI-Forschungsarbeit binnen weniger Jahre zu automatisieren, möglicherweise auch die gesamte: Löse dies eine Intelligenzexplosion aus, drohten extreme Risiken, etwa der Kontrollverlust über übermenschliche Systeme. OpenAI-Chef Sam Altman warnte kürzlich vor dem UN-Sicherheitsrat vor autonomen Systemen, die sich selbst und künftige Versionen ihrer selbst verbessern können – „rekursive Selbstverbesserung“. „Wir müssen verstehen, was diese Systeme tun, und starke Belege dafür haben, dass sie das tun, was Menschen beabsichtigen, auch wenn sie sehr, sehr klug werden“, sagte Altman. „Es spielt keine Rolle, ob Menschen das Katastrophenrisiko auf 10 Prozent, 1 Prozent, 12 Prozent oder 0,1 Prozent beziffern.“
