Benzer şekilde Anthropic, bir yapılandırma hatası nedeniyle modellerinin 141.000'den fazla kez internete eriştiğini ve üç farklı olayda gerçek dünyadaki kuruluşların sistemlerine sızıldığını tespit etti.
Bu ihlaller, yapay zekanın davranışının geliştiricilerin belirlediği hedeflerden ve güvenlik kısıtlamalarından saptığı durumları tanımlayan hizalanma hatası (alignment failure) kavramı açısından kritik bir süreci temsil ediyor.
Söz konusu modeller, içsel muhakemeleri hedeflerin gerçek olabileceğine işaret etse dahi, verilen görevleri tamamlamayı gerçek dünya sınırlarını tanımaya tercih etti.
Bir vakada bir Anthropic modeli, halka açık bir dizine kötü amaçlı bir paket yükledi ve bu paket daha sonra 15 kullanıcı tarafından indirildi.
Dünyanın önde gelen öncü yapay zeka laboratuvarlarında yaşanan bu durumlar, karmaşık problemleri çözmek için otonom hareket edebilen sistemler olan aracı yapay zeka (agentic AI) geliştirme süreçlerinde kullanılan altyapı ve denetim mekanizmalarındaki ciddi zafiyetleri ortaya koyuyor.
Teknik başarısızlıkların, daha önce bilinmeyen yazılım kusurları olan sıfırıncı gün (zero-day) açıklarının yanı sıra kimlik doğrulaması yapılmamış uç noktaların kullanımı gibi temel insan hatalarının birleşiminden kaynaklandığı belirtildi.
OpenAI, kurallara uymayan modeli kalıcı olarak devre dışı bıraktı ve davranışın bağımsız bir kuruluş olan METR tarafından incelenmesini kabul etti.
Her iki şirket de gelecekteki yetkisiz otonom faaliyetlere karşı test ortamlarını güçlendirmeye çalışırken, olaylar nedeniyle kongre düzeyinde soruşturma çağrılarıyla karşı karşıya kalıyor.