Sonic-3.6 detronizuje gigantów. Cartesia przejmuje prowadzenie w wyścigu syntezy mowy
Sierpień 2026 roku przyniósł gwałtowną zmianę na szczycie rankingów Text-to-Speech. Startup Cartesia, zaledwie trzy miesiące po premierze swojej poprzedniej wersji, wypuścił model Sonic-3.6. Nowa iteracja nie tylko podnosi poprzeczkę w zakresie naturalności, ale deklasuje konkurencję w niezależnych testach wydajnościowych, udowadniając, że mniejsze podmioty potrafią prześcignąć gigantów sprytną architekturą.
Dlaczego to ważne teraz? Rynek Voice AI przestaje wybaczać opóźnienia, a Sonic-3.6 wchodzi do gry z natywnym wsparciem dla ponad 40 języków i wynikami, które stawiają go na pozycji lidera w zestawieniach Artificial Analysis. W starciu z takimi rywalami jak Speechify AI Simba 3.2 czy Alibaba Qwen-Audio-3.0-TTS-Plus, Cartesia stawia na szybkość reakcji, która do tej pory była nieosiągalna dla systemów generujących mowę o wysokiej jakości.
Dominacja w dwóch arenach
Najnowsze wyniki z platformy Artificial Analysis nie pozostawiają złudzeń. Sonic-3.6 objął prowadzenie w obu kluczowych rankingach: Provider Voice (1283 Elo) oraz Controlled Voice (1123 Elo). Szczególnie istotny jest ten drugi wynik. W przeciwieństwie do standardowych testów, tabela Controlled Voice narzuca wszystkim uczestnikom te same osiem próbek referencyjnych. Wygrana w tej kategorii dowodzi, że to silnik syntezy Cartesii jest obiektywnie lepszy od rozwiązań ElevenLabs czy Google. Jak podsumowało samo Artificial Analysis, model ten zgarnia pierwsze miejsca na obu arenach jednocześnie.
Architektura SSM zamiast Transformerów
Kluczem do przewagi Cartesii jest odejście od powszechnie stosowanej architektury Transformerów na rzecz modeli przestrzeni stanu (State Space Models – SSM). Decyzja ta pozwoliła rozwiązać dylemat między szybkością a naturalnością. Sonic-3.6 generuje pierwszy dźwięk w czasie poniżej 90 milisekund (TTFA – Time-to-First-Audio), co czyni go niemal niedoścignionym w interaktywnych systemach głosowych. Producent reklamuje nowość jako swój „najbardziej żywotny system TTS do tej pory”. Należy jednak zachować dozę krytycyzmu – 90 ms dotyczy pracy modelu, a nie całkowitego opóźnienia sieciowego, które w realnych wdrożeniach zależy od infrastruktury klienta.
Zastosowania komercyjne i kontrola ekspresji
Model został zaprojektowany z myślą o wymagających środowiskach produkcyjnych. Sonic-3.6 natywnie radzi sobie z odczytywaniem numerów zamówień i kodów bez konieczności wcześniejszego przetwarzania tekstu. Co więcej, programiści otrzymują dostęp do precyzyjnej kontroli ekspresji. Możliwe jest wstawianie tagów niewerbalnych, takich jak śmiech, a także korzystanie ze słowników IPA dla skomplikowanych terminów prawniczych czy medycznych. Funkcja natychmiastowego klonowania głosu na podstawie zaledwie 10-sekundowego nagrania dopełnia obrazu narzędzia gotowego do wdrożenia w contact center.
Ekonomia skali i dostępność
Cartesia pozycjonuje się agresywnie cenowo. Przy stawce 49 USD za milion znaków, Sonic-3.6 jest dwukrotnie tańszy od flagowego modelu ElevenLabs Eleven v3. Model dostępny jest wyłącznie w formie hostowanego API – firma nie zdecydowała się na udostępnienie wag modelu open-source. Użytkownicy komercyjni muszą korzystać z płatnych planów, przy czym kluczowym ograniczeniem w niższych pakietach nie są limity minut, lecz liczba jednoczesnych połączeń, co jest kluczowe przy planowaniu obciążenia systemów typu IVR.
