GELECEKSİZLER

RADAR ·

OpenAI araştırmacısı Brown, güvenlik testlerinin model hızına yetişemediğini söyledi

OpenAI araştırmacısı Noam Brown, sektörün test alışkanlıklarının yayın takvimine yetişemediğini söyledi. Dwarkesh Patel'in programında konuşan Brown, sınır modellerin artık en geç iki ayda bir, bazen daha sık çıktığını; aynı modellerin şimdiden bir hafta süren görevleri yürütebildiğini, yakında bir ay ve üç ay süren görevlere geçeceğini belirtti. Görev süresi iki yayın arasındaki aralığı aştığında bir modeli yeteneklerinin tam uzunluğunda sınamanın yolu kalmadığını söyledi. Brown, uzun görevlerde ürün başarımının ya da hizalamanın bozulup bozulmadığını sınamak için de yeterli zaman kalmadığını, bunun bugün sorun olmasa da hızla soruna dönüştüğünü ekledi. Brown'a göre birçok şirketin güvenlik politikaları GPT-4 döneminde yazıldı ve uzun ufuklu ajanlar için güncellenmedi.

“you don't have a way to evaluate the models at the full length of their capabilities”Noam Brown, OpenAI araştırmacısı

Kaynak: Dwarkesh Patel

← Radar'a dön