Bez kategorii

Nemotron 3 Diarization rozdziela głosy do ośmiu rozmówców

Nvidia udostępniła bezpłatnie wagi modelu Nemotron 3 Diarization. Narzędzie dzieli materiał audio na segmenty i przypisuje wypowiedzi do poszczególnych osób. System potrafi śledzić do ośmiu rozmówców jednocześnie, wykrywa nakładające się głosy i obsługuje zarówno gotowe nagrania, jak i dźwięk przesyłany w czasie rzeczywistym.

W teście VoiceArena Diarization-Bench v1, obejmującym 139 anglojęzycznych rozmów o łącznej długości około 22 godzin, model uzyskał wskaźnik błędu diarizacji (DER) na poziomie 14,72 proc. przy zerowym marginesie czasowym (collar 0 ms). Wartość tę obliczono z uwzględnieniem nakładającej się mowy i automatycznego wykrywania aktywności mówców. Przy tolerancji 250 ms wynik wyniósł 4,29 proc. Dla porównania, kolejny system w tym samym zestawieniu osiągnął 19,3 proc. DER przy braku marginesu.

Podczas przetwarzania strumieniowego model pozwala wybrać jedno z czterech ustawień bufora — od 30,4 do 0,32 sekundy. Krótszy bufor oznacza mniejsze opóźnienie w przekazywaniu wyników, ale wiąże się ze spadkiem precyzji. Przy buforze wynoszącym 1,04 sekundy średni wskaźnik błędów był o 41 proc. niższy niż w starszym modelu Streaming Sortformer w ośmiu sprawdzanych scenariuszach.

System nie identyfikuje tożsamości uczestników rozmowy, lecz nadaje im anonimowe etykiety, takie jak „speaker_1” czy „speaker_2”. Po zestawieniu z modelem automatycznego rozpoznawania mowy (ASR), na przykład Parakeet, umożliwia generowanie pełnej transkrypcji z podziałem na role.

Dokładność narzędzia zależy od warunków nagrania. Wyższy poziom błędów pojawia się przy silnym pogłosie, znacznym hałasie otoczenia oraz w dynamicznych dyskusjach z udziałem większej grupy osób.