RADAR ·
Nvidia, en çok sekiz konuşmacıyı ayıran ücretsiz Nemotron 3 Diarization'ı yayımladı

Nvidia, bir konuşmada o an kimin konuştuğunu belirleyen Nemotron 3 Diarization modelini yayımladı. Yaklaşık 100 milyon parametreli modelin ağırlıkları ücretsiz olarak indirilebiliyor. Model en fazla sekiz konuşmacıyı ayırt edebiliyor, birden fazla kişinin aynı anda konuştuğu bölümleri de algılıyor ve hem kayıtlarla hem canlı sesle çalışıyor. Katılımcı sayısı, arka plan gürültüsü ve yankı arttıkça hata oranı yükseliyor.
Parakeet gibi bir konuşma tanıma sistemiyle birlikte kullanıldığında konuşmacı etiketli döküm çıkarabiliyor; etiketler ise "speaker_2" gibi isimsiz kalıyor. VoiceArena'nın Diarization-Bench testinde model yüzde 14,72 hata oranıyla ilk sırada; ikinci sistemin hata oranı yüzde 19,3. Model, 1,04 saniyelik ses tamponuyla sekiz test senaryosunda önceki Streaming Sortformer modeline göre hatayı ortalama yüzde 41 azaltıyor. Tampon süresi 0,32 ile 30,4 saniye arasında dört seviyeye ayarlanabiliyor; kısa tampon genellikle doğruluğu düşürüyor.
Kaynak: The Decoder