Anthropic, 14 Ağustos'tan itibaren ücretli planlardaki yeni Claude Code oturumları için Auto Mode'u varsayılan yapıyor — bu değişim, insan onay tıklamalarının yerine her ajan eylemini tehlikeye karşı tarayan yapay zekâ sınıflandırıcılarını koyuyor.
Yeni bir Anthropic mühendislik yazısında ayrıntıları verilen Auto Mode, güvenli ama bakımı zor bir kum havuzu ile istemleri tamamen devre dışı bırakan --dangerously-skip-permissions bayrağı arasında konumlanıyor. Ajanı iki katman koruyor: Sunucu tarafı bir komut enjeksiyonu karşıtı tarayıcı, araç çıktılarını ajanın bağlamına ulaşmadan tarıyor; Sonnet 4.6 üzerinde çalışan bir işlem kaydı sınıflandırıcısı ise her eylemi yürütülmeden önce değerlendiriyor — hızlı bir filtre, yalnızca bir şey işaretlenirse zincir düşünce muhakemesi. Sınıflandırıcı bilinçli olarak yalnızca kullanıcı mesajlarını ve araç çağrılarını görüyor; bu "muhakeme-kör" tasarım, ajanın kendini korumaların ötesine konuşarak geçirememesini sağlıyor.
İç değerlendirmelerde boru hattı, zararsız eylemlerin %99,6'sını doğru geçirdi; gerçek aşırı hevesli eylemlerin %83'ünü ve sentetik veri dışa sızıntısı denemelerinin %94,3'ünü yakaladı. Engellenen eylemler ajanı daha güvenli bir yol bulmaya zorluyor; üç ardışık veya toplam 20 ret sonrasında bir insan devreye giriyor. Anthropic ayrıca Claude Code oturumlarının birbirine doğrudan mesaj göndermesine izin verdi; paralel oturumlar terminaller ve makineler arasında bağlam paylaşabiliyor.




