Bu başarı, sistemin çok sayıda adımdan oluşan ve zaman içinde hatalardan kurtulma yeteneği gerektiren uzun vadeli otonom çalışmaları sürdürme kapasitesini kanıtlıyor.
Bu gelişme, GPU çekirdeklerini (işlemcilerin verileri nasıl işlediğini yöneten yazılımlar) optimize etmek gibi özelleşmiş teknik görevler için kullanılan yapay zeka altyapısının, genel amaçlı muhakeme süreçlerine de uygulanabileceğini göstermesi açısından büyük önem taşıyor.
Önceki testlerde AVO, FlashAttention-4 gibi mevcut endüstri standartlarını geride bırakan yüksek performanslı kodlar üretmek için yedi gün boyunca otonom olarak çalışmıştı.
Hem üst düzey mühendislikte hem de etkileşimli mantık oyunlarında başarılı olan bu mimari, güvenilir yapay zeka performansının sadece temel dil modeline değil, bellek ve araçları yöneten çevreleyici sisteme (harness) bağlı olduğunu ispatlıyor.
AVO mimarisi, ilerlemeyi sürdürmek için kalıcı bellek ve denetleyici olmak üzere iki temel mekanizmadan faydalanıyor.
Kalıcı bellek, ajanın geçmiş sonuçları ve muhakemeleri geleceğe taşımasına izin vererek bir başarısızlık sonrası arama sürecini yeniden başlatma zorunluluğunu ortadan kaldırıyor; denetleyici ise duraklamaları izleyerek ajanın tıkanması durumunda onu yeniden yönlendiriyor.
Claude Opus 5 ve GPT-5.6 Sol gibi farklı öncü modellerle çalışabilecek şekilde tasarlanan bu teknik çerçeve, otonom ajanların geleceğinin farklı endüstrilerde kanıt toplayabilen ve kendi stratejilerini geliştirebilen standartlaştırılmış sistemlerde yattığına işaret ediyor.