Şirket içi kullanımın halihazırda yaygın olduğunu belirten Anthropic, neredeyse tüm çalışanlarının günlük iş akışlarında bu otonom yapılandırmayı kullandığını bildirdi.
Bu hamle, kullanıcıların sürekli onay vermekten dolayı dikkatinin dağılması ve tehlikeli komutları fark etmeden onaylaması anlamına gelen "onay yorgunluğunu" (confirmation fatigue) gidermeyi hedefliyor.
1.000'den fazla yazılımcıyla yapılan bir çalışma, insanların zararlı eylemlerin yalnızca %13,6'sını yakalayabildiğini, buna karşın otomatik modun aynı tehditlerin %89'unu engellediğini ortaya koydu.
Şirket, özellikle yanlışlıkla veri silinmesi veya üretim hatalarına karşı manuel denetimden daha tutarlı bir güvenlik katmanı sağlamayı amaçlıyor.
Otonom geçişe olan güveni artırmak için Anthropic, Trajectory Labs tarafından gerçekleştirilen ve dolaylı komut enjeksiyonu (indirect prompt injection) risklerine odaklanan değerlendirmeleri paylaştı.
Testler, otomatik modda çalışan Claude modellerinin 720 saldırı girişiminin tamamını engellediğini gösterdi.
Bu durum yapay zeka altyapı güvenliğinde önemli bir ilerlemeye işaret etse de, araştırmacılar sistemin hala otomatik savunmaları baypas edebilecek kötü amaçlı üçüncü taraf yazılım paketleri gibi karmaşık tehditlerle karşı karşıya kalabileceğini not ediyor.