Audio

Alibaba prezentuje Qwen3-ASR: uniwersalny model rozpoznawania mowy

Alibaba Cloud, za pośrednictwem swojego zespołu Qwen, zaprezentowała Qwen3-ASR Flash, kompleksowy model automatycznego rozpoznawania mowy (ASR). Model ten, dostępny jako usługa API, bazuje na architekturze Qwen3-Omni i ma na celu uproszczenie procesu transkrypcji w różnorodnych scenariuszach – od wielojęzyczności, przez zaszumione otoczenie, po specyficzne słownictwo branżowe.

Qwen3-ASR wyróżnia się kilkoma kluczowymi cechami. Przede wszystkim, obsługuje automatyczne rozpoznawanie i transkrypcję w 11 językach, w tym angielskim, chińskim, arabskim, niemieckim, hiszpańskim, francuskim, włoskim, japońskim, koreańskim, portugalskim i rosyjskim. Tak szeroki zakres językowy sprawia, że model ten może być stosowany globalnie bez konieczności korzystania z oddzielnych modeli dla każdego języka.

Kolejną istotną cechą jest mechanizm „wstrzykiwania kontekstu”. Użytkownicy mogą wprowadzać dowolny tekst – nazwy własne, żargon branżowy, a nawet ciągi znaków pozbawione sensu – aby wpłynąć na proces transkrypcji. To szczególnie przydatne w sytuacjach, gdzie występuje duża ilość idiomów, nazw własnych lub nowo powstałych terminów.

Model charakteryzuje się także dużą odpornością na zakłócenia dźwiękowe. Utrzymuje wysoką jakość rozpoznawania mowy nawet w hałaśliwym otoczeniu, przy nagraniach niskiej jakości, przy dźwiękach pochodzących z oddalonych mikrofonów oraz w przypadku materiałów multimedialnych, takich jak piosenki czy rap. Zgłaszany współczynnik błędów słownych (WER) utrzymuje się poniżej 8%, co jest imponującym wynikiem, biorąc pod uwagę tak różnorodne źródła dźwięku.

Kluczową zaletą Qwen3-ASR jest jego prostota. Eliminuje on konieczność utrzymywania oddzielnych modeli dla różnych języków lub kontekstów audio. Wszystkie zadania realizowane są przez jeden model, dostępny poprzez API.

Zastosowania Qwen3-ASR są szerokie. Może być wykorzystywany w platformach edukacyjnych (nagrywanie wykładów, wielojęzyczne korepetycje), w mediach (napisy, voice-over) oraz w obsłudze klienta (wielojęzyczne systemy IVR, transkrypcja rozmów). Automatyczne wykrywanie języka upraszcza pracę w środowiskach, gdzie używa się wielu języków. Możliwość „wstrzykiwania kontekstu” pozwala na dostosowanie modelu do specyficznego słownictwa branżowego bez konieczności jego ponownego uczenia.

Utrzymywanie WER poniżej 8% w trudnych warunkach akustycznych stawia Qwen3-ASR w czołówce systemów rozpoznawania mowy. Obsługa aż 11 języków, w tym chińskiego (język logograficzny) oraz języków o zróżnicowanej fonotaktyce, takich jak arabski i japoński, świadczy o obszernym zbiorze danych treningowych i dużej zdolności do modelowania międzyjęzykowego. Istotne jest również to, że model radzi sobie zarówno z językami tonalnymi (mandaryński), jak i nietonalnymi.

Qwen3-ASR Flash to interesujące rozwiązanie ASR, łączące w sobie obsługę wielu języków, uwzględnianie kontekstu i odporność na zakłócenia. Demonstracja modelu dostępna jest na Hugging Face.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *