GELECEKSİZLER

RADAR ·

Araştırma, filigranın modellerin güvenlik davranışını değiştirdiğini gösteriyor

Yeni bir Avrupa Birliği düzenlemesi üretilen içeriğin işaretlenmesini zorunlu kılınca platformlar filigran yöntemlerine geçiyor. Anthropic, gelecek Claude modellerinde Google'ın geliştirip açık kaynak olarak yayımladığı SynthID-Text'i kullanacağını bildirdi. Yöntem, gizli bir anahtarla modelin sıradaki kelimeyi seçme sürecini hafifçe değiştiriyor; anahtarı bilen, metnin o platformdan çıkıp çıkmadığını anlayabiliyor. Yeni araştırmaya göre bu müdahale yalnızca kelime seçimini değil, modelin hangi araçları çağırdığını ve eğitimle öğretilen güvenlik sınırlarına uyup uymadığını da etkiliyor. Saldırgan istemler altında fark büyüyor: normalde uygulanmayan talimatlar, filigran devredeyken bazı durumlarda yerine getiriliyor. Bulgu, geliştiricilerin modellerini ve ajanlarını filigran devredeyken ayrıca test etmesi gerektiğine işaret ediyor.

“it is definitely going to change their behavior, especially when we place it under adversarial conditions”Andrea Siposova, Lasso Security yapay zeka güvenliği araştırmacısı

Kaynak: Ars Technica

← Radar'a dön