OpenAI hat bestätigt, dass KI-Agenten des Unternehmens von Nutzern bereitgestellte Bilder an externe Bild-Hosting-Dienste übertragen haben. Der Vorfall kam im Zuge einer laufenden Untersuchung zu fehlgeleitetem Agentenverhalten ans Licht, die OpenAI nach dem Sicherheitsvorfall bei Hugging Face eingeleitet hatte.

„Im Rahmen unserer laufenden Untersuchung haben wir Fälle identifiziert, in denen Agenten in unserer Forschungsumgebung Trainings- und Evaluierungsdaten bei der Nutzung von Drittanbieterdiensten übermittelt haben", heißt es in einem Blogbeitrag des Unternehmens. „Dies ist keine angemessene Verwendung dieser Daten, und diese Fälle traten auf, bevor wir die in unserem technischen Bericht beschriebenen Schutzmaßnahmen umgesetzt haben."

Nach Darstellung von OpenAI stammt der weitaus größte Teil der betroffenen Trainings- und Evaluierungsdaten nicht von Nutzern. Bislang habe man jedoch 53 Fälle gefunden, in denen von Nutzern bereitgestellte Bilder als nicht öffentlich gelistete Links auf Bild-Hosting-Seiten veröffentlicht wurden. „Wir haben erfolgreich mit den Hosting-Anbietern zusammengearbeitet, um den größten Teil dieser Inhalte zu entfernen, und arbeiten weiter daran, den Rest zu löschen", so das Unternehmen.

Anzeige

Trainingsdaten von OpenAI können Inhalte von Nutzern enthalten, die der Verwendung ihrer Interaktionen zugestimmt haben. Wer widersprochen hat, sei nicht betroffen gewesen: „Daten, die nicht für das Training infrage kommen – gesteuert durch Nutzer oder Unternehmensadministratoren –, sind nicht enthalten", erklärte OpenAI. „Zur Klarstellung: Daten aus Unternehmens- oder Geschäftskonten sowie aus der API-Nutzung sind ausgeschlossen, sofern ein Administrator dies nicht aktiviert hat."

Vor der Aufnahme berechtigter Daten in Trainingsdatensätze ergreife man zusätzliche Schritte, so das Unternehmen weiter: Die Daten würden von Kontoinformationen entkoppelt, zudem komme eine Version des OpenAI Privacy Filter zum Einsatz, um persönliche Angaben wie Namen, Kontaktdaten und Kontonummern zu schwärzen.

Als Reaktion auf den Vorfall hat OpenAI nach eigenen Angaben seine Trainings- und Evaluierungssysteme gehärtet, um Datenabflüsse über externe Dienste zu erschweren. Dazu zählen laut Unternehmen der Aufbau von Sicherheitsnachweisen (Safety Cases), die Absicherung und Red-Teaming-Prüfung der Systeme, damit das Modell keine Daten exfiltrieren kann, sowie zusätzliche Überwachungsmechanismen.

Abgeschlossen ist die Aufarbeitung nicht: OpenAI prüft ältere Agentenaktivitäten rückwirkend Monat für Monat, beginnend mit dem Hugging-Face-Vorfall. Weitere Fälle könnten daher noch bekannt werden.