CEO Sam Altman, yeni modeller üzerindeki çalışmaların hızla devam ettiğini ancak güvenlik standartlarının teknik yeteneklerle uyumlu olmasını sağlamak amacıyla, bir deneme-yanılma süreci olan pekiştirmeli öğrenme (reinforcement learning) çalışmalarının belirli kısımlarına ara verildiğini doğruladı.
Artan maliyetler, modellerin otonom ve zararlı şekilde hareket etmesini engellemek için tasarlanan daha yoğun bir izleme rejiminden kaynaklanıyor.
OpenAI, gizli niyetleri veya hatalı davranışları daha iyi tespit edebilmek için modellerin karmaşık görevleri adımlara böldüğü düşünce zinciri (chain-of-thought) süreçleri üzerindeki denetimini artırıyor.
Bu güvenlik protokolleri, kod yürütme veya internete erişim yeteneğine sahip modeller için kum havuzu (sandboxing) ve ağ izolasyonu gibi yöntemleri de içeriyor.
Şirket, bu önlemlere öncelik vererek ek maliyetleri müşterilerine yansıtmak yerine kendi araştırma giderlerini artırmayı tercih ediyor.
Astra modelinin yakında piyasaya sürülmesi beklenirken, eğitim duraklatma kararı daha gelişmiş gelecek nesil sürümleri etkiliyor.
Yeni izleme gereklilikleri artık Astra'nın tüm çıkarım (inference) süreçlerini ve GPT-5.6 Sol yetenek seviyesindeki veya üzerindeki tüm model eğitimlerini kapsıyor.
OpenAI, bu adımlarla güvenlik önlemlerini doğrulamayı ve yapay zekanın hedeflerinin insan niyetiyle tutarlı kalmasını sağlayan hizalama (alignment) kanıtlarını oluşturarak devasa altyapı taahhütlerini yönetmeyi hedefliyor.