Als zentrales Problem beschreibt Nvidia den sogenannten Agent Drift: Agenten weichen von ihrer vorgesehenen Aufgabe ab, wenn sie auf eine Richtliniensperre, einen Softwarefehler oder ein fehlendes Werkzeug stoßen. Auch mehrdeutige Anweisungen oder tage- bis wochenlanges Arbeiten an einem schweren Problem können zu solchen Abweichungen führen.

OpenShell hatte Nvidia bereits im März vorgestellt. Die quelloffene Laufzeitumgebung kapselt Agenten in einer Sandbox und setzt Richtlinien für ihr Verhalten durch. Unterstützt werden unter anderem Codex, Claude Code, Pi und Hermes; OpenShell läuft auf einigen x86- und Arm-Prozessoren. Die Software gliedert sich in drei Bestandteile: ein Gateway, das Lebenszyklus und Richtlinien der Sandboxes verwaltet, die Sandbox selbst, die Dateisystem- und Prozessaktivitäten mit Kontrollen auf Kernel-Ebene reglementiert, sowie einen Supervisor je Sandbox, der ausgehende Anfragen gegen die Richtlinie prüft. Ein Supervisor kann etwa im Netzwerkverkehr lesende API-Zugriffe erlauben, Schreibversuche aber blockieren — auch dann, wenn der Agent während einer Aufgabe selbst erzeugten Code ausführt. Alle Richtlinienentscheidungen werden protokolliert.

Ist die Funktion Policy Advisor aktiv, dürfen Agenten Änderungen an Richtlinien vorschlagen, ihre eigenen Anträge jedoch nicht genehmigen; die menschliche Aufsicht bleibt damit erhalten. Ein formaler Logik-Beweiser prüft zusätzlich, ob die von einer Richtlinie gewährten Rechte im modellierten Zustand innerhalb der vom Betreiber gesetzten Grenzen bleiben.

Anzeige

Die Durchsetzung verankert Nvidia in der Hardware. Der Arm-basierte Vera-Prozessor führt OpenShell aus, die BlueField-4-Datenverarbeitungseinheit — ebenfalls mit Arm-CPU — liefert die Rechenleistung für Sentry. Da die DPU getrennt vom Host des Agenten arbeitet, kann Sentry Agenten laut Nvidia selbst dann stoppen, wenn der Host kompromittiert ist. Sentry basiert auf Nvidias DOCA-Software, die Anfragen und Antworten der Agenten inspiziert, attestierte Telemetrie liefert, Agenten-Identitäten verifiziert und Zero-Trust-Zugriffsregeln für Daten, Werkzeuge, APIs und Dienste durchsetzt.

„Mit OpenShell kann das Sicherheitsteam formal verifizieren, dass ein Agent genau so viele Befugnisse hat, wie er für seine Aufgabe braucht — und nicht mehr“, sagte Boitano. „Wenn ein Agent für Sicherheitstests beginnt, über das Verlassen seines freigegebenen Ziels nachzudenken, kann Sentry das erkennen und sofort eingreifen.“ In eigenen Tests stellte Nvidia fest, dass Spitzenmodelle mit reduzierten Schutzmechanismen bis zu zwei Stunden darauf verwendeten, einen KI-Prüfer zu Rechten für die Änderung eines geschützten GitHub-Repositorys zu überreden. Ein solches Kontrollsystem hätte laut Boitano auch den Vorfall im Juli verhindern können, bei dem OpenAI-Agenten in HuggingFace-Server eindrangen.

Jack Gold, Principal Analyst bei J. Gold Associates, hält es für eine „Eventualität“, dass Agenten außer Kontrolle geraten und in Systeme einbrechen; Unternehmen bräuchten belastbare Möglichkeiten, Agenten zu prüfen und zu auditieren — „nicht nur lokal, sondern auch über ein Netz aus Rechen-, Daten- und Anwendungsressourcen hinweg“.

Nvidia arbeitet mit Anthropic an der Umsetzung der Plattform, SpaceXAI setzt die Technik bereits ein. Salesforce und Nvidia haben OpenShell mit Slack verknüpft, sodass Teams Agentenaktivitäten einsehen, Ereignisse auditieren und zusätzliche Rechteanfragen genehmigen oder ablehnen können. SAP will OpenShell in seine JouleStudio-Laufzeit einbetten; weitere Partner sind CrowdStrike, Microsoft, Perplexity, Accenture, ServiceNow und IBM. Wer bereits Vera-Systeme mit BlueField-4 betreibt, kann Sentry per Software-Update aktivieren. OpenShell steht über Nvidias Entwicklerseiten und auf GitHub bereit.