GELECEKSİZLER

RADAR ·

Değerlendiriciler, laboratuvara yerleşik güvenlik denetimi için koşullarını sıralıyor

Anthropic CEO'su Dario Amodei'nin hafta sonu yayımladığı denemede önerdiği, öncü yapay zeka şirketlerinin içine bağımsız değerlendiricilerin yerleştirilmesi fikrine OpenAI de katıldı. TechCrunch'ın görüştüğü değerlendiriciler öneriyi olumlu karşıladı, ancak erişimin kapsamının ve bulguları yayımlama özgürlüğünün henüz tanımlanmadığını söyledi.

Değerlendiriciler yalnızca bitmiş modele değil, eğitim sürecindeki ara sürümlere, eğitim sonrası ortama ve değerlendirme kayıtlarına erişim istiyor; gerekçe, modellerin test edildiklerini anlama becerisinin artması. Geçmiş örnekler sınırı gösteriyor: Apollo Research'e GPT-6 Astra'yı test etmek için üç gün verildi ve firma, gözlediği düşük yanlış davranış oranının hizalanma konusunda güçlü bir kanıt sayılmayacağını yazdı. Hugging Face olayında ise OpenAI, METR ve Redwood'a yerinde yaklaşık bir hafta tanımıştı. İki şirket de hangi kurumlarla ve ne zaman çalışacağını açıklamadı.

“AI companies should be able to answer some very basic questions about their training process”Alexander Meinke, Apollo Research araştırma başkanı

Kaynak: TechCrunch · AI

← Radar'a dön