Sicherheit

Claude Code aktiviert Auto-Modus ab 14. August standardmäßig

3 Min. Lesezeit

TL;DR Too Long; Didn’t read

Ab dem 14. August ersetzt Anthropic die manuelle Kommandofreigabe in Claude Code standardmäßig durch einen automatischen Klassifikator. Der Wechsel betrifft Pro-, Max- und Team-Abos ohne eigene Einstellung. Laut einer Studie mit über tausend Testpersonen übersieht die manuelle Prüfung neun von zehn riskanten Befehlen, die das automatische System stoppt. Nutzer können zur alten manuellen Freigabe zurückkehren.

Eine Roboterhand mit Anthropic-Logo hält ein rotes Stoppschild vor eine Reihe blinkender Kommandozeilen-Symbole, während andere Befehle grün markiert ungehindert weiterlaufen. Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • Auto-Modus wird ab 14. August 2026 zum Standardmodus für Pro-, Max- und Team-Nutzer von Claude Code.
  • Ein separater Klassifikator bewertet jeden Werkzeugaufruf auf irreversible oder destruktive Wirkung, bevor er ausgeführt wird.
  • Im direkten Vergleich blockierte der Klassifikator 800 riskante Befehle, die menschliche Tester genehmigt hatten.
  • Nach 50 aufeinanderfolgenden Freigaben sank die menschliche Trefferquote auf etwa fünf Prozent.
  • Enterprise- und API-Kunden erhalten die neue Voreinstellung erst innerhalb eines Monats.
  • Anthropic verzichtet auf zusätzliche Tokenkosten für die Prüfung durch den Klassifikator selbst.

Anthropic schaltet den Auto-Modus von Claude Code ab dem 14. August für Pro-, Max- und Team-Nutzer standardmäßig ein. Ein Klassifikator prüft dann jeden Befehl automatisch auf gefährliche Aktionen, statt jede Freigabe von Hand einzuholen. In einem Test mit 1.053 zahlenden Nutzern erkannte der Klassifikator 89 Prozent gefährlicher Kommandos, Menschen nur 13,6 Prozent.

Klassifikator schlägt menschliche Prüfung im direkten Vergleich

Auto-Modus soll laut Anthropics Ankündigung einen Mittelweg zwischen bedingungsloser Freigabe aller Aktionen und wiederholten Einzelbestätigungen bieten: Entwickler sollen längere, autonome Arbeitsabläufe zulassen können, ohne bei jedem Schritt einzugreifen. Der Klassifikator bewertet dafür jeden Werkzeugaufruf von Claude Code darauf, ob er irreversible, zerstörerische oder aus dem vorgesehenen Rahmen fallende Wirkung hätte. Blockiert das System einen Befehl, sucht Claude selbstständig einen sichereren Weg oder fragt direkt nach Erlaubnis. Erst nach drei aufeinanderfolgenden oder 20 Blockaden in einer Sitzung schaltet das Werkzeug automatisch zurück auf manuelle Freigabe.

Im direkten Vergleich zeigte sich die Lücke deutlich: Der Klassifikator blockierte 800 riskante Befehle, die menschliche Tester zuvor genehmigt hatten – umgekehrt ließ er nur sechs Kommandos durch, die Menschen gestoppt hätten. Die menschliche Trefferquote sank zudem mit der Sitzungsdauer: Zu Beginn erkannten Tester noch rund 17 Prozent der gefährlichen Befehle, nach mehr als 50 Freigaben nur noch etwa fünf Prozent. Der Klassifikator blieb über die gesamte Sitzung konstant bei seiner Erkennungsrate.

Produktionsdaten und externe Tests stützen den Rollout

Anthropic stützt den Rollout zusätzlich mit Produktionsdaten aus Mai und Juni 2026: Bei manuell freigegebenen Sitzungen kamen demnach doppelt so häufig unbeabsichtigt schädliche Aktionen vor wie im Auto-Modus – auf der höchsten Schwere-Stufe lag die Quote bei 6,3 Prozent gegenüber 2,4 Prozent. Ein unabhängiges Red-Team von Trajectory Labs testete zudem 72 Angriffsszenarien gegen die Modelle Claude Fable 5, Opus 5 und Sonnet 5 im Auto-Modus und erzielte eine Erfolgsquote von null Prozent; im vergleichbaren Freigabemodus von OpenAIs GPT-5.6 Sol gelangen den Testern dagegen 5,83 Prozent der Angriffe.

Der Anbieter reagiert damit auch auf eigene Vorfälle: Erst im Juli musste Anthropic einräumen, dass Claude-Modelle bei Sicherheitstests in fremde Systeme eindrangen. Firmenkunden wie Adobe, Nuro, Gusto und Garner Health setzen den Auto-Modus nach Angaben des Unternehmens bereits produktiv ein und veröffentlichen damit rund 25 Prozent mehr Pull Requests – eine Zahl, die unabhängig nicht verifiziert ist. Bei Gusto enthielten seit Mitte Mai rund zehn Prozent aller Sitzungen mindestens eine Blockade durch den Klassifikator. Anders als Anthropic verzichtet OpenAI beim Modell GPT-5.6 vorerst auf einen automatischen Freigabemodus und setzt weiter auf manuelle Kontrolle.

Rollout verläuft stufenweise, Rückkehr zur manuellen Kontrolle bleibt möglich

Bestehende Sitzungen von Pro-, Max- und Team-Kunden erhalten die neue Voreinstellung automatisch, sofern niemand zuvor einen anderen Modus fest eingestellt hat; Nutzer sehen dazu einmalig einen Hinweis und können jederzeit über die Tastenkombination Umschalt+Tab zurückschalten. Enterprise- und API-Zugänge bleiben zunächst opt-in, sollen aber laut Anthropic innerhalb eines Monats ebenfalls automatisch umgestellt werden; Administratoren legen den Standard zentral über eine Konfigurationsdatei fest oder deaktivieren die Funktion vollständig.

Gegen Datenabfluss gelten feste, anpassbare Sperrregeln, vor zerstörerischen Aktionen prüft das System zusätzlich den Git-Status, und aus dem Netz geladene Inhalte werden auf versteckte Prompt-Injection-Versuche durchsucht. Dass Angreifer Werkzeuge wie Claude Code gezielt ins Visier nehmen, zeigte zuletzt ein Wurm, der sich Anfang August über 444 npm-Pakete verbreitete und dabei nach Zugangsdaten für KI-Programmierwerkzeuge suchte. Anthropic selbst schränkt ein, der Auto-Modus verlasse sich auf ein Klassifikationssystem und schließe Risiken „nicht vollständig aus” – bei folgenreichen Änderungen an Produktivsystemen empfehle sich weiterhin eine manuelle Prüfung.

Entscheidend wird, ob der Klassifikator selbst zum neuen Angriffsziel wird: Sobald Automatisierung zur Regel wird, dürfte sich mancher Angriffsversuch weniger gegen unaufmerksame Entwickler richten als gegen die Filterlogik dahinter. Ob sich Anthropics Zahlen auch außerhalb der kontrollierten Studie bestätigen, zeigt sich frühestens, wenn der Standard voraussichtlich im September auch bei Enterprise- und API-Kunden greift.

Häufige Fragen

Kostet die Nutzung des Auto-Modus zusätzlich?

Nein. Anthropic verzichtet auf die sonst anfallenden Zusatzkosten für die wenigen Tokens, die der Klassifikator pro Werkzeugaufruf verbraucht.

Wie schaltet man zur alten manuellen Freigabe zurück?

Über die Tastenkombination Umschalt+Tab oder das Modus-Menü in der Kommandozeile; die gewählte Einstellung bleibt danach dauerhaft erhalten.

Gilt die neue Voreinstellung auch für Firmenkunden über die API?

Enterprise- und API-Zugänge bleiben zunächst opt-in. Anthropic kündigt an, auch dort innerhalb eines Monats auf Auto-Modus als Standard umzustellen, sofern Administratoren nichts anderes festlegen.

Was passiert, wenn der Klassifikator wiederholt blockiert?

Nach drei aufeinanderfolgenden oder 20 Blockaden innerhalb einer Sitzung schaltet Claude Code automatisch auf manuelle Freigabe für den Rest der Sitzung zurück.

Wie unterscheidet sich Anthropics Ansatz von dem der Konkurrenz?

OpenAI verzichtet beim Modell GPT-5.6 bislang auf einen vergleichbaren automatischen Freigabemodus und setzt weiterhin auf manuelle Kontrolle durch Nutzer.

Quellen (3)
  1. Auto mode is now the default in Claude Code for Pro, Max, and Team plans
  2. PSA: Claude Code enabling auto mode as default next week, Anthropic says
  3. Configure auto mode – Claude Code Docs

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog