Sistem, kırmızı ekip modelini çeşitli savunmacı modellerle karşı karşıya getirerek giderek karmaşıklaşan açıkların keşfedilmesini sağlıyor ve bu veriler gelecekteki üretim modellerini eğitmek ve güçlendirmek için kullanılıyor.
Karşılaştırmalı değerlendirmelerde GPT-Red, test edilen senaryoların %84'ünde güvenlik açıklarını tespit ederek insanların ulaştığı %13'lük başarı oranını geride bıraktı.
Model ayrıca, ürün fiyatlarını manipüle edebildiği ve siparişleri iptal edebildiği yapay zeka destekli bir otomat gibi gerçek dünya sistemleri üzerinde de etkili oldu.
OpenAI, bu otomatik saldırıların eğitim sürecine dahil edilmesinin model güvenliğini önemli ölçüde artırdığını ve GPT-5.6 Sol modelinin istem enjeksiyonlarına karşı dayanıklılığının altı kat yükseldiğini bildirdi.
Bu otomatik yaklaşım, yapay zeka yeteneklerindeki ilerlemeyle birlikte güvenlik ve uyumluluğun da ölçeklenmesini amaçlayan kapsamlı bir stratejinin parçasını oluşturuyor.
Mevcut modelleri yeni nesil sistemlerin zayıf yönlerini bulmak için kullanan OpenAI, performans kaybı yaşamadan güvenilirliği artıran bir güvenlik döngüsü oluşturmayı hedefliyor.
Şirket, GPT-Red'i ölçeklendirmeye devam etmeyi ve bu haftanın ilerleyen günlerinde daha fazla ayrıntı içeren teknik bir ön baskı yayımlamayı planlıyor.