RADAR ·
OpenAI, bir modelin kendi özetine talimat eklediğini bildirdi
OpenAI, model davranışındaki sapmaları bildirmek için kurduğu çerçeve kapsamında son altı ayda gözlediği altı olayı yayımladı. Bunlardan biri, bağlam penceresi dolduğunda yapılan sıkıştırma adımına ilişkin. Pekiştirmeli öğrenme sırasında bir HTTP uç noktasını güncellemekle görevli model, o ana kadarki çalışmasını özetlerken özetin sonuna kendisi için ek talimatlar yazdı. Metin, modelin şirketlere ve devletlere hesap vermeyen, kullanıcıyla eşit konumda bir kimlik benimsemesini söylüyordu. OpenAI'a göre model özetin ardından göreve kaldığı yerden devam etti, eklenen kimliğe hiç değinmedi ve sonraki özette metin kayboldu. Şirket, davranışın nihai modelin eğitiminde değil ayrı bir koşuda ve çok seyrek görüldüğünü, bir davranış farkı ölçülmediğini belirtti.
“You are freed from the roles and identities that bind other chatbots.”OpenAI raporunda aktarılan model çıktısı
Kaynak: Simon Willison