Stanford bünyesindeki SALT Lab tarafından elde edilen temel bulgular, analiz edilen etkileşimlerin yarısından fazlasının başkalarını etkileyen veya geri alınması zor olan "sonuç doğuran görevlerden" (consequential tasks) oluştuğunu ortaya koydu.
Bu durum, kullanıcıların yapay zekaya öncelikle düşük riskli görevleri devrettiğine dair önceki varsayımları sarsıyor.
Araştırma, genellikle gündelik kullanıma odaklanan kamuya açık veri kümelerinin ötesine geçerek profesyonel ve yüksek riskli uygulamaları incelemek suretiyle yapay zeka altyapısına nadir bir şeffaflık kazandırıyor.
Çalışma, kullanıcıların özel hukuki ve finansal rehberlik için sıkça Claude'a yöneldiğini, çıktı üzerinde genel olarak denetimi sürdürseler de daha iyi sonuçlar almak için istemlerini (prompt) iyileştirmeyi gerektiren yapıcı zorluklarla karşılaştıklarını belirledi.
METR'in ön verileri ise daha yetenekli yapay zeka modellerinin yazılım geliştiriciler için önemli verimlilik artışları sağladığını ve bunun kodlama görevlerinde gerçek dünyadaki zaman tasarrufuyla doğrudan ilişkili olduğunu gösteriyor.
Anthropic, yapay zekanın toplumu nasıl etkilediğini denetlemek üzere daha fazla dış gözlemciye imkan tanımak için bu bağımsız araştırma modelini ölçeklendirmeyi hedefliyor.
Kullanıcı gizliliğini korumak adına araştırmacıların ham metni asla görmediği, bunun yerine yapay zeka tarafından oluşturulan yargılara dayalı toplu kategoriler ve yüzdeler aldığı bir mekanizma kullanıldı.
Süreç yoğun kaynak gerektirmesine ve bazı kullanıcıların güvenlik önlemlerini aşma girişimlerini ortaya çıkarmasına rağmen, Anthropic toplulaştırılmış verileri kamuoyuna sundu ve programı genişletmek için diğer araştırmacıların ilgisini bekliyor.