Anthropic macht den Auto-Modus ab dem 14. August zum Standard für neue Claude-Code-Sitzungen in kostenpflichtigen Plänen – eine Umstellung, die menschliche Genehmigungsklicks durch KI-Klassifizierer ersetzt, die jede Aktion eines Agents auf Gefahren prüfen.

Der Auto-Modus liegt zwischen einer sicheren, aber wartungsintensiven Sandbox und dem Flag --dangerously-skip-permissions, das alle Abfragen abschaltet. Zwei Ebenen schützen den Agenten: Eine serverseitige Prompt-Injection-Sonde scannt Werkzeugausgaben, bevor sie den Kontext erreichen; ein auf Sonnet 4.6 laufender Transkript-Klassifizierer bewertet jede Aktion vor der Ausführung – mit einem schnellen Filter und Chain-of-Thought-Schlussfolgerungen nur bei Auffälligkeiten. Der Klassifizierer sieht nur Benutzernachrichten und Tool-Aufrufe und ist dadurch bewusst reasoning-blind, sodass ein Agent sich nicht an den Schutzmechanismen vorbeireden kann.

In internen Auswertungen ließ die Pipeline 99,6 % der harmlosen Aktionen korrekt durch, erkannte 83 % der echten übereifrigen Aktionen – bei denen ein Agent über das vom Nutzer Autorisierte hinausgeht – und 94,3 % der synthetischen Datenexfiltrationsversuche. Blockierte Aktionen zwingen den Agenten, einen sichereren Weg zu finden; nach drei aufeinanderfolgenden oder insgesamt 20 Ablehnungen übernimmt ein Mensch. Anthropic erlaubt Claude-Code-Sitzungen zudem, sich gegenseitig direkt Nachrichten zu senden, sodass parallele Sitzungen Kontext über Terminals und Maschinen hinweg teilen können.