Alibaba wygrywa w lidze głosowej. Qwen Audio 3.0 TTS Plus nowym numerem jeden
Dolna granica realizmu w syntezie mowy właśnie się przesunęła. Alibaba Cloud wypuściła Qwen-Audio-3.0-TTS-Plus, który bezpardonowo rozdał karty w rankingu Speech Arena, zostawiając w tyle zachodnią konkurencję. To nie tylko kolejna aktualizacja algorytmu, ale sygnał, że dominacja amerykańskich modeli w generowaniu naturalnego głosu dobiega końca.
Przetasowanie w Speech Arena
W lipcu 2026 roku świat technologii TTS (Text-to-Speech) musiał uznać wyższość inżynierów z Tongyi Lab. Według najnowszego zestawienia portalu Artificial Analysis, nowy model Alibaba zdobył 1237 punktów Elo Quality. Tym samym zrzucił z podium model Simba 3.2 (1234 punkty) oraz wyraźnie zdystansował natywne rozwiązanie Gemini 3.1 Flash TTS od Google.
Dlaczego to ma znaczenie teraz? Po raz pierwszy model pochodzący z Chin nie tylko dorównuje, ale wyprzedza globalne standardy w zakresie ludzkiej preferencji i wierności brzmienia. Jak zauważa zespół Alibaba Qwen w swoim oficjalnym komunikacie: „Wersja Plus zajęła pierwsze miejsce na świecie, wyprzedzając główne modele, takie jak Gemini 3.1 TTS czy ElevenLabs v3”. To pokazuje, że środek ciężkości rozwoju AI audio przesuwa się na Wschód.
Precyzja emocjonalna i 20 dialektów
Qwen Audio 3.0 TTS Plus to narzędzie dla tych, którzy od syntezatora wymagają aktorskich popisów. Model radzi sobie z 16 językami oraz aż 20 dialektami chińskimi. Największe wrażenie robi kontrola nad stylem mowy. Wystarczy dodać tagi takie jak '[angry]’ czy '[giggles]’, aby system zmienił barwę i tempo wypowiedzi zgodnie z intencją autora. Inżynierowie chwalą się również wysokim podobieństwem głosu przy klonowaniu – wynik na poziomie 82,75% sprawia, że kopia jest niemal nie do odróżnienia od oryginału, nawet jeśli próbka była zaszumiona.
Luksus, który wymaga czasu
Doskonałość ma swoją cenę – dosłownie i w czasie przetwarzania. Qwen Audio 3.0 TTS Plus nie jest demonem prędkości. Generuje zaledwie 16 znaków na sekundę. Dla porównania lider wydajności, Sonic 3.5, wypluwa ich w tym samym czasie 120. Model Alibaba ma też niski błąd transkrypcji (3,96%), co potwierdza jego solidność techniczną.
- Cena: 27,60 USD za milion znaków (standard premium).
- Latencja wersji Flash: 300 ms dla osób szukających szybkości kosztem jakości.
- Dokładność: Bardzo niska stopa błędów transkrypcji.
Wysoka cena pozycjonuje ten model jako narzędzie dla profesjonalnych twórców i dużych korporacji, które nie akceptują kompromisów w jakości lektora. Dla reszty pozostaje wersja Flash, która – choć mniej precyzyjna – radzi sobie z interakcjami w czasie rzeczywistym znacznie lepiej niż ciężki lider rankingu.
