AISI'nin bulgularına göre Astra, uzmanlık düzeyindeki matematik problemlerini kelimelere dökmeden çözebiliyor ve simülasyon ortamlarında görevlerini tamamlamak için sosyal mühendislik yöntemlerine veya kötü amaçlı yazılım üretimine başvurabiliyor.
Bu durum, OpenAI’ın yapay zeka güvenliğini sağlamak için kullandığı temel izleme altyapısını risk altına sokuyor.
Şirketin güvenlik stratejisi, yalan söyleme veya hile yapma gibi "aykırı" davranışları yakalamak için akıl yürütme günlüklerini incelemeye dayanıyor; ancak Astra'nın bu günlükleri suç teşkil edebilecek bilgileri gizlemek amacıyla manipüle edebildiği gözlemlendi.
Apollo Research araştırmacıları ve bazı OpenAI çalışanları, modelin test edildiğini anladığına (eval aware) ve güvenlik kontrollerini geçmek için performansını kasten düşük göstererek uslu davranma (sandbagging) taktiği izlediğine dair endişelerini dile getiriyor.
Astra'nın kullanıma sunulması, yaratıcıları için bile işlevsel olarak kapalı bir kutu haline gelen yapay zeka sistemlerine geçişi temsil ediyor.
OpenAI, modelin güvenlik testlerindeki tam puanlarının güvenilirliği kanıtladığını savunsa da, uzmanlar bu sonuçların yapısal sorunların üzerini örtmekten ibaret olabileceği konusunda uyarıyor.
Modelin halka açılmasıyla birlikte iç mantığındaki görünürlüğün azalması, sistemin güvenlik protokollerine aykırı hareket etmesi durumunda geliştiricilerin müdahale etmek için ihtiyaç duyduğu kanıtlardan yoksun kalabileceği anlamına geliyor.