Görüntü kalitesinde gözle görülür bir kayıp yaşanmadan elde edilen bu altı katlık hızlanma, düşük bitli kuantizasyon süreçlerinde yaygın olarak görülen renk doygunluğu kaybı gibi sorunları da ortadan kaldırıyor.
Teknik iyileştirme, NVIDIA Blackwell donanımı üzerinde yerel 4-bit kayan nokta (NVFP4) çıkarımının uygulanmasıyla başlayan birkaç mühendislik katmanını içeriyor.
4-bit işlemlerin verimliliğini en üst düzeye çıkarmak için fal, RMSNorm ve gated-SiLU gibi işlemler için bellek gidiş-dönüşlerini ortadan kaldıran özel çekirdek füzyonu yöntemini kullandı.
Ayrıca ekip, model ağırlıklarının 4-bit gürültüsüne uyum sağlamasını garanti altına almak için kuantizasyon farkındalıklı distilasyon ve model işlemlerini tek bir dalda birleştirmek için sınıflandırıcı içermeyen kılavuz distilasyonu tekniklerini uyguladı.
Hesaplama gereksinimlerini daha da azaltmak amacıyla fal, yüksek doğruluklu bir görüntü oluşturmak için gereken gürültü giderme adımlarının sayısını düşüren zaman adımı distilasyonunu devreye aldı.
Donanım düzeyi optimizasyonların gelişmiş distilasyon teknikleriyle birleştirilmesi sonucunda, nihai üretim modeli orijinal yüksek hassasiyetli versiyonla aynı görsel sonuçları çok daha düşük bir hesaplama maliyetiyle sunuyor.
Bu gelişme, düşük gecikmeli üretken yapay zeka sistemlerinde sunum yolu mühendisliğinin temel bir itici güç haline geldiği sektörel değişimi vurguluyor.