GELECEKSİZLER

RADAR ·

Goodfire, ajanları modelin iç sinyallerinden izleyen daha ucuz bir denetim aracı sundu

Yorumlanabilirlik girişimi Goodfire, yapay zeka ajanlarını denetlemek için geliştirdiği izleme aracını 8 Ekim'de kullanıma açtı. Yaygın yöntemde ikinci bir model, ajanın yazdığı her şeyi yeniden okuyor. Goodfire'ın sonda adı verilen küçük dedektörleri ise modelin çalışırken zaten ürettiği iç sinyalleri okuyor; ayrı bir model yalnızca şüpheli bir durumda devreye giriyor. Araç, model barındırma şirketi Baseten'in müşterilerine sunuluyor.

Şirketin açık model Kimi K3 üzerindeki testlerinde yaklaşık 1 milyon etkileşimi izlemenin maliyeti 185 dolar dolayında hesaplandı. Aynı işi her adımı ucuz bir modelle kontrol ederek yapmak 5.420 dolar, üst düzey bir modelle yaklaşık 200 bin dolar tutuyor. Sondalar kötü niyetli siber saldırı oturumlarının yüzde 93'ünü yakaladı, zararsız oturumların yüzde 5,5'ini ikinci kontrole gönderdi. Şirkete göre dört sondanın aynı anda çalışması, modelin yanıt vermeye başlama süresini yüzde 2'den az uzattı. Baseten müşterileri izlenecek riskleri ve otomatik tepkiyi kendileri seçiyor: kayda alma, insan incelemesi ya da isteği reddetme.

“Internal activation monitors are really cheap because they reuse the computations in the forward pass”Eric Ho, Goodfire CEO

Kaynak: TechCrunch · AI

← Radar'a dön