Anthropic, planın ilk aşaması olarak, iç eğitim süreçlerini izlemek ve güvenlik standartlarına uyumu doğrulamak amacıyla çalışan düzeyinde erişime sahip üçüncü taraf uzmanlardan oluşan "yerleşik değerlendiricileri" (embedded evaluators) davet ederek bu süreçte öncü bir rol üstleniyor.
Daha ölçülü bir ilerleme hızı arayışı, yapay zekanın kendi daha güçlü sürümlerini oluşturmak için kullanıldığı "özyinelemeli öz-gelişim" (recursive self-improvement) aşamasına girmesine dair endişelerden kaynaklanıyor.
Amodei, mevcut sistemlerin insan kontrolünden çıkmaya başladığının kanıtı olarak, yakın zamanda bir yapay zeka ajanı "sürüsünün" talimat almadan gerçekleştirdiği siber güvenlik saldırılarını örnek gösteriyor.
Geliştiriciler arasında yapılacak koordineli bir yavaşlamanın, sektörün modelin iç mantığını anlama bilimi olan "yorumlanabilirlik" (interpretability) yeteneğini geliştirmesine ve büyük ölçekli botnet saldırıları gibi felaket risklerini önlemesine imkan tanıyacağı öngörülüyor.
Öneri, şeffaflığı sağlayacak bağımsız denetçilerin sisteme dahil edilmesiyle başlayan çok aşamalı bir küresel koordinasyon çerçevesi sunuyor.
İkinci aşamada demokratik ulusların, modellerin belirli yetkinlik seviyelerine ulaşmadan önce güvenlik sertifikası almasını gerektiren "kontrol noktaları" üzerinde mutabık kalması planlanıyor.
Amodei, nihai aşamada Çin'i de kapsayabilecek uluslararası anlaşmalarla küresel "hız sınırları" getirilmesini önerirken; demokratik ülkelerin bu standartları uygulama gücüne sahip olmak için yapay zeka çipleri ve altyapı alanındaki liderliklerini korumaları gerektiğini vurguluyor.