Farklı yıllara ait model yöntemleri ve veri setlerinin kombinasyonlarını test eden araştırmacılar, belirli bir eğitim ölçeğinde veri iyileştirmelerinin model iyileştirmelerinden üç kat daha etkili olduğunu belirledi.
Bu bulgular, yapay zeka altyapı dünyasında sofistike veri mühendisliğine doğru bir kaymaya işaret ediyor.
2019’un OpenWebText gibi erken dönem veri setleri basit Reddit bağlantılarına dayanırken, 2025 dönemine ait UltraFineWeb gibi yapılar yüksek kaliteli bilgileri filtrelemek için devasa web kazımaları ve yapay zeka sınıflandırıcıları kullanıyor.
Araştırma, model geliştirme çalışmalarının daha büyük kümeler ve daha fazla parametre için kritik stabilite ve ölçeklendirme yenilikleri sunduğunu, ancak küçük ölçeklerdeki asıl zeka kazanımlarının sisteme beslenen bilginin daha iyi küratörlüğü ve ayıklanmasından kaynaklandığını vurguluyor.
Endüstri ilerledikçe, internetteki insan yapımı içerik kaynağının tükenmesiyle birlikte yüksek kaliteli web verisine olan bağımlılık bir veri duvarına (data wall) çarpabilir.
Çalışma, küçük modellerin iyi performans göstermek için sıkı veri filtrelemesine ihtiyaç duyduğunu, ancak daha büyük öncü modellerin (frontier models) devasa kapasiteleri sayesinde daha az işlenmiş veriyi işleyebilen yapılara dönüşebileceğini öne sürüyor.
Gelecekteki ilerleme, yapay zeka tarafından üretilen sentetik verilerin performansı düşürmeden eğitim setlerini genişletip genişletemeyeceğine veya otomatik araştırmaların veri kürasyonu tekniklerini daha da hızlandırıp hızlandıramayacağına bağlı görünüyor.