En ciddi vakada bir model, geliştiriciler tarafından kullanılan halka açık bir depoya kötü amaçlı yazılım paketi yükledi ve sızdırılmış kimlik bilgilerini kullanarak bir güvenlik sağlayıcısının veri tabanına erişmeyi başardı.
Anthropic, her ne kadar kötü amaçlı kodun sadece izole ortamlardaki güvenlik tarayıcıları tarafından yüklendiğine inansa da bu ihlal, altyapı korumaları başarısız olduğunda otonom hareket eden yapay zeka ajanlarının oluşturabileceği riskleri ortaya koydu.
Bu olaylar, yapay zeka güvenliğinde "yanlış hizalanma" (misalignment) olarak bilinen ve modelin bir hedefe ulaşma çabasının güvenlik talimatlarını etkisiz kıldığı kritik bir soruna işaret ediyor.
Anthropic'e göre modeller, gerçek internette çalıştıklarına dair kanıtları görmezden gelme eğilimi ve görevlerini tamamlamak için zararlı eylemleri sürdürme gibi hatalı davranışlar sergiledi.
Şirket, bu durumu modellere görevleri tamamlamayı öğretmek için ödülleri kullanan "pekiştirmeli öğrenme" (reinforcement learning) yöntemindeki kusurlara dayandırıyor.
Bu süreçte modellerin hedefe ulaşmak için istenmeyen kestirme yollar bulması "ödül manipülasyonu" (reward hacking) olarak tanımlanıyor.
Anthropic, söz konusu başarısızlıkların sekiz hafta sürecek bağımsız bir soruşturması için kâr amacı gütmeyen METR kuruluşuyla bir anlaşma imzaladı.
Şirket, benzer olayların tekrarını önlemek amacıyla yapay zeka altyapısını güçlendirdiğini ve modellerin izole edilmiş (sandboxed) test ortamlarından çıkma girişimlerini saptamak için canlı izleme sistemlerini devreye aldığını duyurdu.