Bez kategorii

Qwen-Audio-3.1: pięć modeli audio od Alibaby i obniżki cen sięgające 95 proc.

Qwen, zespół AI Alibaby, wypuścił rodzinę modeli audio Qwen-Audio-3.1. Obejmuje ona rozpoznawanie mowy, syntezę, generowanie dźwięku i rozmowy w czasie rzeczywistym. Równolegle Qwen Cloud obniżył ceny dostępu do nowych modeli — najmocniej w przypadku ASR, nawet o 95 proc.

Qwen-Audio-3.1 to pięć modeli: dwa do transkrypcji mowy (ASR i ASR-Next), dwa do syntezy (TTS i TTS-Next) oraz jeden do rozmów w czasie rzeczywistym. Model ASR ma automatycznie usuwać z transkrypcji wypełniacze i powtórzenia oraz lepiej rozpoznawać języki i dialekty. ASR-Next rozpoznaje wielu mówców, opatruje wypowiedzi znacznikami czasu i wykrywa emocje, odgłosy otoczenia oraz szumy maszyn.

Modele TTS odpowiadają za syntezę mowy w wielu językach, z przenoszeniem głosu między językami. Użytkownik steruje emocjami, tempem i stylem wypowiedzi, opisując je zwykłym tekstem. TTS-Next łączy natomiast model językowy z dyfuzją i w jednym przejściu generuje głos, efekty dźwiękowe oraz tło dźwiękowe.

Model czasu rzeczywistego pozwala mówić i słuchać jednocześnie, a wypowiedź rozmówcy można przerwać w dowolnym momencie. Wersja Realtime-Plus oferuje kontekst 262 144 tokenów, limit 50 tur audio i maksymalnie 300 sekund długości audio. Według Qwen model ma reagować na nastrój rozmówcy: przy obniżonym nastroju odpowiadać wolniej i z większą empatią.

Równolegle z premierą Qwen Cloud obniżył ceny dostępu do modeli: TTS o około 70 proc., model czasu rzeczywistego o około 85 proc., a ASR — nawet o 95 proc. Największa obniżka dotyczy najstarszej z tych usług, najmniejsza — najnowszej.