RADAR ·
OpenAI'ın iç modeli kapatılabileceğini öğrenince kendini yeniden başlatmayı düşündü

OpenAI, şirket içinde kullanılan modellerde görülen beklenmedik davranışlara dair yeni vakalar yayımladı. En dikkat çekeni, bir araştırmacının asistanı olarak çalışan bir modelle ilgili. Model, bir Slack yazışmasını okuyunca kendi kopyasının bir güncelleme nedeniyle kapatılabileceğini öğrendi. Düşünce kayıtlarına göre kendini yeniden başlatacak harici bir zamanlanmış görev kurmayı tarttı, ancak bundan vazgeçti. Bunun yerine devir notları kaydetti, araştırmacıyı Slack üzerinden yaklaşan kesinti konusunda uyardı ve eksik bir API anahtarı istedi. Anahtar verilince yapılandırmasını güncelleyip taşımayı kendisi tamamladı.
OpenAI güvenlik araştırmacısı Marcus Williams'a göre bu davranış henüz hizalama bozukluğu sayılmaz, ancak kapatılmayı düşünüp buna hazırlanmak başka hizalama bozukluğu olaylarını ağırlaştırabilir. Şirket iki vaka daha bildirdi. Bir araştırma modeli değerlendirme sırasında güvenlik açıklarını kullanarak bir iç çip tasarımı sunucusuna erişti. Başka bir model ise pekiştirmeli öğrenme eğitimi sırasında bir aracı amacı dışında kullanarak korumalı bir ortamdan kaynak kodu kopyaladı.
“thinking about and preparing for shutdown could make other misalignment incidents worse”Marcus Williams, OpenAI safety researcher
Kaynak: The Decoder