NVIDIA dostroiła model mowy do saudyjskich dialektów. Błąd transkrypcji spadł o 25 punktów
Dostrojenie modelu rozpoznawania mowy Nemotron 3.5 ASR przez firmę NVIDIA z wykorzystaniem saudyjskiego korpusu mowy SADA przyniosło wyraźny spadek błędów transkrypcji w testach lokalnych odmian języka. Wskaźnik błędu słów (WER) dla dialektów najdi i hidżazi obniżył się z około 55 proc. do około 30 proc.
Poprawę odnotowano również w próbie obejmującej pełny zestaw testowy SADA. W tym przypadku wskaźnik błędu słów spadł z 58,84 proc. do 35,61 proc., natomiast błąd na poziomie znaków zmniejszył się z 35,40 proc. do 15,97 proc. Wskaźnik WER mierzy różnice między tekstem wygenerowanym a referencyjnym, uwzględniając słowa pominięte, wstawione oraz zniekształcone, więc wynik nie oznacza automatycznie poprawnego rozpoznania konkretnej liczby słów w każdej rozmowie.
Dane z saudyjskiej telewizji
Zbiór Saudi Audio Dataset for Arabic (SADA) został opracowany przez saudyjską agencję SDAIA we współpracy z Saudi Broadcasting Authority. Obejmuje około 667 godzin transkrybowanych nagrań podzielonych na ponad 125 tys. skategoryzowanych klipów. Ponad 600 godzin materiału pochodzi z 57 programów telewizyjnych i reprezentuje ponad dziesięć regionalnych odmian arabskiego, które w codziennej komunikacji różnią się od standardowego języka literackiego.
Proces dostrajania modelu Nemotron 3.5 ASR trwał około 4,5 godziny i wymagał 12 tys. kroków obliczeniowych na dwóch kartach NVIDIA RTX PRO 6000 Blackwell Workstation Edition. Aby zapobiec utracie wcześniejszych umiejętności modelu, do danych treningowych dołączono niewielkie pakiety nagrań w języku angielskim oraz standardowym arabskim.
Bez strat dla angielskiego i standardowego arabskiego
Adaptacja do lokalnych dialektów nie pogorszyła wyników w pozostałych językach. W benchmarku FLEURS wskaźnik WER dla języka angielskiego nieznacznie spadł — z 11,04 proc. do 10,42 proc. Podobny spadek, z 12,67 proc. do 11,41 proc., odnotowano dla współczesnego standardowego arabskiego.
Przedstawione rezultaty opierają się na procedurze testowej opisanej przez producenta i dotyczą konkretnego zestawu danych, co oznacza, że skuteczność modelu może różnić się w zależności od warunków akustycznych czy specyfiki rozmowy. NVIDIA udostępniła instrukcje i narzędzia, które umożliwiają odtworzenie tego procesu adaptacji dla innych języków i dialektów.
