ElevenLabs wypuszcza Eleven v4. Aktualizacja stawia na spójność głosu i wariant Turbo
ElevenLabs udostępniło model mowy Eleven v4 oraz jego szybszy wariant Eleven v4 Turbo. Główną zmianą względem poprzednika ma być większa niezawodność w realizowaniu instrukcji reżyserskich i utrzymywaniu jednolitego brzmienia głosu w dłuższych materiałach. Wersja Turbo została z kolei zoptymalizowana pod kątem natychmiastowych odpowiedzi w rozmowach z agentami głosowymi i interakcjach w grach.
Użytkownicy mogą sterować sposobem wypowiedzi za pomocą tagów lub instrukcji tekstowych określających emocje, pauzy czy efekty dźwiękowe. Choć obsługa tego typu znaczników była obecna już w wersji v3, ElevenLabs deklaruje, że v4 znacznie precyzyjniej reaguje na polecenia szeptu, śmiechu czy zmiany dynamiki. Nowa architektura ma analizować ton, tempo oraz kontekst całej sceny w dialogach, zamiast przetwarzać poszczególne kwestie w izolacji.
Lepsza kontrola i praca na fragmentach
Model ma również stabilniej utrzymywać charakter postaci przy ponownym generowaniu pojedynczych zdań oraz pewniej stosować fonetyczny zapis trudnych nazwisk i terminów specjalistycznych.
Pojedyncze zapytanie do v4 może obejmować do 10 tys. znaków, co przekłada się na około dziesięć minut nagrania. Dłuższe formaty, na przykład audiobooki, wciąż wymagają dzielenia tekstu na części, jednak producent twierdzi, że model lepiej zachowuje spójne tempo w miejscach łączenia fragmentów.
Aktualizacja zwiększa też deklarowaną liczbę obsługiwanych języków z około 70 do ponad 90. Według firmy sklonowany głos potrafi płynnie mówić w obcych językach z zachowaniem rodzimej fonetyki. W przypadku funkcji szybkiego klonowania (Instant Voice Clone) do przygotowania profilu wystarcza dziesięciosekundowa próbka audio.
Wariant Turbo i pomiary producenta
Wariant Eleven v4 Turbo zaprojektowano z myślą o minimalizacji opóźnień. Z testów przeprowadzonych przez ElevenLabs wynika, że model zaczyna generować słyszalną mowę po około 150 milisekundach. W tych samych wewnętrznych pomiarach firmy konkurencyjny Cartesia Sonic 3.6 potrzebował 262 milisekund, a OpenAI GPT-4o mini TTS – 814 milisekund.
Dokumentacja modelu podaje medianę inferencji v4 Turbo na poziomie około 100 ms, natomiast testy producenta wskazują około 150 ms do rozpoczęcia słyszalnej mowy. Dostępne informacje nie opisują metodologii obu pomiarów, dlatego nie pozwalają stwierdzić, czy wyniki są bezpośrednio porównywalne.
Również dane dotyczące jakości i preferencji słuchaczy pochodzą z materiałów producenta. ElevenLabs podaje, że w teście wymowy v4 osiągnął 91,7 proc. poprawności (wobec 85,6 proc. dla v3), a w ślepych testach odsłuchowych około trzy czwarte uczestników wskazało nowy model jako bardziej naturalny od rozwiązań konkurencji.
Oba warianty trafiły do narzędzi ElevenAgents i ElevenCreative oraz są dostępne przez API. W ElevenCreative model v4 udostępniono bez dodatkowej opłaty dla użytkowników planu Creator+, do wysokości dwukrotności miesięcznych kredytów. Standardowe stawki wynoszą 80 dolarów za milion znaków dla v4 i 40 dolarów dla Turbo, przy czym do 12 października obowiązują ceny promocyjne obniżone odpowiednio do 22 i 11 dolarów.
