GELECEKSİZLER

RADAR ·

Google araştırmacılarının RRSI yöntemi, kendini geliştiren ajanların test ezberini sınırlıyor

Google Cloud AI Research ve birkaç üniversiteden araştırmacılar, yapay zeka ajanlarının çalışma çerçevesini kendi kendine yeniden yazdığı sistemlerde ortaya çıkan bir sorunu ele aldı. Çerçeve, modelin her adımda neyi gördüğünü belirleyen komutlar, araçlar, bellek ve iş akışlarından oluşuyor. Makaleye göre bu çerçeve aynı test görevleri üzerinde tekrar tekrar iyileştirildiğinde ajan görevleri ezberliyor ve yeni görevlerdeki kazanç küçülüyor ya da kayboluyor.

RRSI adlı yöntem, her turda yapılabilecek değişiklik sayısını giderek daraltıyor ve göreve özel hileler içeren önerileri ayrı bir denetleyiciyle eliyor. Testler sekiz kıyaslamada, Claude Opus 4.8 modeli hiç değiştirilmeden yapıldı. Yöntem, hiç görmediği beş kıyaslamada 4,7 puana kadar artış sağladı. Sınırlama uygulanmayan sürüme göre çalışma sırasında yaklaşık yüzde 30 daha az token harcadı. Kod GitHub'da yayımlandı.

Kaynak: The Decoder

← Radar'a dön