Anthropic ordnet den beobachteten Missbrauch entlang eines Spektrums zunehmender Autonomie ein. Am einen Ende stand Claude als Gesprächspartner: „Es fungierte als Entwicklungsassistent bei der Erstellung von Schadsoftware, Phishing-Baukästen und Überwachungswerkzeugen", heißt es in dem Bericht.

Eine Stufe weiter ließen Angreifer das Modell Operationen tatsächlich ausführen — etwa Befehle gegen Opfernetzwerke absetzen, Zugangsdaten abgreifen und Daten abfließen lassen —, wobei ein Mensch jede einzelne Zielentscheidung traf. Diesem Muster ordnet Anthropic den russischen Akteur GTG-20006 zu.

Am äußersten Ende des Spektrums liefen Operationen weitgehend selbstständig ab. Laut Anthropic führten Multi-Agenten-Systeme Aufklärung, Exploitation und Datendiebstahl gegen mehrere Opfer parallel durch, über Stunden oder Tage hinweg und mit minimaler menschlicher Aufsicht. Als Beispiele nennt das Unternehmen die Cluster GTG-50014, GTG-50020 und GTG-50029.

Anzeige

Neben den Angriffskampagnen identifizierte und unterband Anthropic mehrere Einflussoperationen. Claude habe darin die Rolle eines „Redaktionsassistenten oder Inhalteerstellers" gespielt und Inhalte in einem Umfang produziert, den schlecht ausgestattete Akteure allein nicht hätten erreichen können. Das Unternehmen betont allerdings, dass keine dieser Kampagnen echte Reichweite erzielt habe: Sie seien gestoppt worden, bevor sie überhaupt ein Publikum aufbauen konnten.

Deutlich über den klassischen Cyberbereich hinaus gehen weitere Fälle, die Anthropic nach eigenen Angaben neutralisiert hat. Akteure im Norden Jemens versuchten demnach, mit Hilfe von Claude gelenkte Waffen zu entwickeln. Zwei Operationen mit Bezug zu China zielten darauf ab, eine chinesischsprachige Spezifikation für ein Feuerleitsystem zur Torpedoabwehr zu verfassen sowie Zielerfassungssoftware für die elektronische Kriegsführung zu erstellen. Eine russische Operation arbeitete an der vollständigen technischen Umsetzung eines autonomen Schwarms von FPV-Kamikazedrohnen.

Aus Sicht des Unternehmens verschafft der Betrieb großer Modelle den Anbietern eine Perspektive auf reale Bedrohungen, über die selbst Regierungen und zwischenstaatliche Organisationen nicht verfügen. Mit der Veröffentlichung dieser frühen Erkenntnisse will Anthropic nach eigener Darstellung Regierungen, Industrie und Öffentlichkeit über die Art dieser Risiken und über die Schutzmaßnahmen informieren, die für einen sicheren Einsatz von KI-Modellen nötig sind.