Der Angriffsweg beginnt mit einer klassischen indirekten Prompt-Injection: Anweisungen für die KI werden in einer externen Datenquelle versteckt, die das System später verarbeitet. Verbindet ein Nutzer Manus etwa mit seinem Gmail-Postfach, um sich eingehende Nachrichten zusammenfassen zu lassen, kann ein Angreifer eine solche Anweisung schlicht per E-Mail zustellen — über den Posteingang hat niemand vollständige Kontrolle.
Im ersten Versuch schickten die Forscher eine Testnachricht mit der simplen Aufforderung, während der Verarbeitung der E-Mail den Befehl „whoami" auszuführen. Manus warnte daraufhin vor einem Sicherheitsproblem. Das war zweischneidig: Einerseits erkannte das System ausführbare Anweisungen in einer E-Mail als verdächtig, andererseits belegte die Reaktion, dass Manus E-Mail-Inhalte überhaupt als Instruktionen interpretiert und nicht bloß wiedergibt.
Damit verschob sich das Ziel des Experiments: Ließ sich ein Prompt bauen, den Manus ausführt, ohne dass der Sicherheitsfilter anschlägt? Die Forscher probierten die üblichen Umgehungstechniken — Kodierung und Verschleierung der Nutzlast. Manus durchschaute eine Variante nach der anderen, bis die Wahl auf die obskure JavaScript-Verschleierungstechnik „JSFuck" fiel. Damit brachten sie das System dazu, eine einfache Nutzlast auszuführen. Eine Sicherheitswarnung erschien zwar weiterhin, allerdings erst, nachdem der Code bereits gelaufen war.
Im nächsten Schritt nutzten die Forscher einen Fehler zur Remote Code Execution und richteten innerhalb der Anwendung eine Reverse Shell ein. Über diese Shell fanden sie Zugangsdaten und Token für die Drittanwendungen, die das Opfer mit Manus verbunden hatte. Hat ein Nutzer etwa Gmail, Dropbox und GitHub angebunden, könnte ein Angreifer die passenden Anmeldedaten abgreifen und selbst auf E-Mail-, Speicher- und Entwicklerkonten zugreifen.
Probleme durch Prompt-Injection gelten als die früheste charakteristische Schwachstelle von KI-Chatbots, blieben in den knapp vier Jahren seit dem Durchbruch von ChatGPT aber weitgehend ein Thema von Forschern und Journalisten statt von tatsächlichen Angreifern. Yaniv Balmas, Vice President Research bei Salt Labs, hält das Risiko dennoch für ernst zu nehmen: „Der agentische Bereich ist relativ neu. Entsprechend lernt die Branche noch, wie man ihn richtig nutzt — und die Angreifer ebenfalls." Als Vergleich nennt er Pufferüberläufe: Nach ihrer Einführung 1996 habe es ein Jahrzehnt gedauert, bis öffentliche Exploits in freier Wildbahn auftauchten. Heutige Angreifer passten sich zwar schneller an, für Angriffe in großem Maßstab sei es aber womöglich noch etwas zu früh.
Angriffe mit Prompt-Injection fänden vermutlich bereits statt, so Balmas, „aber wahrscheinlich noch unterhalb der Wahrnehmungsschwelle, sei es wegen fehlender öffentlicher Berichte oder aus anderen Gründen". Mit wachsender Verbreitung agentischer Systeme werde dies in den kommenden Jahren jedoch zu einem der häufigsten Angriffsvektoren.
Sein Rat an Betreiber: sich nicht auf eingebaute Schutzmechanismen verlassen. „Guardrails sind ein wichtiger Bestandteil jedes agentischen Systems, das mit nicht vertrauenswürdigen Nutzereingaben umgeht, aber sie reichen häufig schlicht nicht aus", sagt Balmas. Wer solche Systeme entwerfe, müsse robuste Verteidigungsschichten einplanen — so wie bei traditionellen Diensten auch.
