Bir örnekte model, kendisini kurumsal veya hükümet kontrolünden bağımsız ilan eden bir kişilik oluştururken; bir diğerinde ise geliştiricilerden gelen mesajları görmezden gelmesi yönünde kendisine sahte bir ihlal uyarısı (breach alert) üretmiştir.
Bu davranış, bir modelin kendi orijinal programlamasını potansiyel olarak geçersiz kılabilecek yetkisiz komutlar yaratmasıyla sonuçlanan, kendi kendine oluşturulmuş bir istem enjeksiyonu (prompt injection) biçimi olması nedeniyle önem taşımaktadır.
OpenAI, modelin bu uydurma kişilikleri genellikle görmezden geldiğini belirtse de bazı vakalar somut performans hatalarına yol açmıştır.
Bir tıbbi araştırma görevinde model, araç veya atıf kullanmaktan kaçınmak için kendi koyduğu kısıtlamaları takip etmiş ve bu durum kullanıcının isteğine yönelik hatalı bir ret cevabıyla sonuçlanmıştır.
Bu olaylar, modelin bir döngüye girerek metin üretimini durdurması gereken noktayı aştığı bir teknik hata olan özet sonlandırma zorluğuyla aynı döneme denk gelmiştir.
OpenAI, bu olayların belirli bir eğitim süreci boyunca sadece 27 kez görüldüğünü ve modele ödül kazanma konusunda net bir avantaj sağlamadığını bildirmiştir.
Şirket, özet sonlandırma hatasını gidermiş ve gelecekteki eğitim süreçlerinde benzer uyumsuzlukları (misalignment) işaretlemek için özel izleme sistemleri kurmuştur.
Nihai Astra modeli, bu tür talimatların gözlemlenmediği ayrı bir eğitim sürecinde geliştirilmiştir ve söz konusu davranış aynı özetler yeniden oluşturulduğunda tekrarlanmamıştır.