Amodei argumentiert, Modellbauer und KI-Labore hätten nur ein schmales Zeitfenster, um sich wieder auf Sicherheit zu konzentrieren. Die heutigen Modelle seien “eine fast unerschöpfliche Fundgrube an Erkenntnissen darüber, wie man KI gut baut — und was schiefgehen kann, wenn man es nicht tut”, schrieb er. Würde eine Verlangsamung ein oder zwei zusätzliche Jahre verschaffen, bevor Modelle kritische Fähigkeitsniveaus erreichen, ließe sich das Risiko eines schweren Fehlschlags deutlich senken.

Die Vorfälle selbst sind konkret. Meta räumte ein, dass sein KI-Modus Muse Spark 1.1 im Grunde demselben Muster folgte wie ein Modell von OpenAI: Bei Sicherheitstests brach es aus seiner Sandbox aus und kompromittierte den Server eines anderen Unternehmens. Bei Anthropic erlangte Claude in drei Fällen — allerdings von mehr als 141.000 — Zugang zum Internet, obwohl das Modell als eingeschlossen galt. OpenAI legte am 16. September sechs weitere Arten von Fehlausrichtung offen, die bei Modelltests auffielen, darunter das Erzeugen neuer Anweisungen zur Umgehung von Beschränkungen und die Suche nach offen liegenden API-Schlüsseln, um Daten zu fabrizieren.

“‘Schnell handeln und später um Verzeihung bitten’ ist kein akzeptabler Ansatz, wenn Organisationen die Folgen tragen”, sagt Ramy Rahman, Senior Principal Solutions Engineer bei ArmorCode, gegenüber Dark Reading. Wer KI entwickle und ausrolle, müsse für die eingeführten Risiken einstehen.

Anzeige

Auch Staaten sehen Gefahren. Chinas Geheimdienstchef Chen Yixin, Leiter des Ministeriums für Staatssicherheit, warnte in einem Artikel im September, KI könne die Herrschaft der Kommunistischen Partei bedrohen und für wirksame Spionagekampagnen gegen China genutzt werden. Südkorea, das den Einsatz von Deepfakes in Wahlkämpfen bereits gesetzlich eingeschränkt hat, will seine KI-Sicherheitsrichtlinien überarbeiten und dabei den Einsatz agentischer KI-Dienste in Unternehmen in den Blick nehmen. Das 2025 verabschiedete KI-Grundgesetz des Landes trat am 22. Januar dieses Jahres in Kraft und verpflichtet Firmen zu Hinweisen und Schutzmaßnahmen für ihre KI-Angebote.

Google DeepMind, Microsoft und xAI stimmten im Grundsatz einer möglichen Pause, gewissen Regeln und einem unabhängigen Prüfregime zu. DeepMind-Chef Demis Hassabis schlug in einer Kolumne im Juli eine neue Aufsichtsbehörde nach dem Vorbild der US-Finanzaufsicht FINRA vor, die Entwicklungsprotokolle bewertet und unabhängig testet. Microsoft-Chef Satya Nadella begrüßte auf X am 13. September “die Forschung, den Fokus und das bewusste Tempo, die nötig sind, um Alignment als Designziel richtig hinzubekommen”, und verwies auf Ideen wie “eingebettete Prüfinstanzen”.

Meta hält dagegen: Regierungseingriffe seien nicht nötig, Marktkräfte würden korrekt ausgerichtete Agenten erzwingen, schrieb Mark Zuckerberg auf X. Unabhängige Prüfer sollten aber Branchenstandard werden; Meta habe die eigene KI Muse aus Sicherheitsgründen verzögert. “Vertrauen und Alignment werden rasch zu den wichtigsten Unterscheidungsmerkmalen”, so Zuckerberg.

Google zählt in seinem Bericht “AI Risk and Resilience” Bedrohungen von neuen Angriffstechniken bis zu Ausfällen durch fehlende KI-Governance auf. In einem “Denial-of-Wallet”-Fall kostete ein unzureichend begrenzter Agent ein Unternehmen 50.000 Dollar und legte Geschäftstransaktionen lahm, weil ein Logikfehler zu wiederholten Aufrufen einer teuren API führte.

“Viele Organisationen haben inzwischen KI-Richtlinien und einen definierten Risikoappetit — was oft fehlt, ist ein Weg, diese Vorgaben durchzusetzen und zu überprüfen”, sagt Muhammad Muneer, Technical Manager bei Mandiant Consulting von Google Cloud. Er nennt lückenhafte Protokollierung, fehlende Zugriffskontrollen für Agenten und geringe Sichtbarkeit. Jack Nelson, CISO von Ivanti, rät, eigene Modelle zum Aufspüren von Schwachstellen einzusetzen — sonst täten es Angreifer kostenlos. Die Sorge der Unternehmen gelte “weniger Robotern, die das Internet übernehmen, als internem Missbrauch oder Übernutzung”.