Bez kategorii

ElevenLabs rozdziela generowanie mowy: v4 do produkcji audio, Turbo do rozmów na żywo

ElevenLabs udostępniło dwa nowe modele syntezy mowy o odmiennych zastosowaniach: Eleven v4, przeznaczony do tworzenia dopracowanych nagrań studyjnych, oraz v4 Turbo, zoptymalizowany pod kątem interakcji głosowych w czasie rzeczywistym. Oba warianty trafiły do platformy producenta i interfejsu ElevenAPI, a wariant Turbo zasila również narzędzie ElevenAgents.

Różnica między modelami sprowadza się do priorytetów technicznych. Eleven v4 kładzie nacisk na ekspresję i spójność w dłuższych materiałach. Model obsługuje ponad 90 języków, generuje do 10 tys. znaków w ramach jednego zapytania i pozwala precyzyjnie sterować sposobem wypowiedzi za pomocą wskazówek tekstowych wplecionych bezpośrednio w skrypt (takich jak [laughs] czy [whispers]). W nowej wersji zrezygnowano z tradycyjnych znaczników pauz SSML na rzecz instrukcji w języku naturalnym. Wraz z v4 wracają również zaawansowane klony Professional Voice Clones, choć dotychczas utworzone głosy Instant i Professional wymagają ponownego przetrenowania, by działać z nową architekturą.

Z kolei wariant v4 Turbo został zaprojektowany z myślą o minimalizacji opóźnień w dialogu. Kluczową nowością jest dwukierunkowe przesyłanie strumieniowe: aplikacja może przekazywać tekst w miarę jego generowania przez model językowy, a syntezator zaczyna zwracać dźwięk, zanim powstanie całe zdanie.

Według deklaracji ElevenLabs mediana opóźnienia wnioskowania w v4 Turbo wynosi około 100 ms, a czas wygenerowania pierwszej wypowiedzi to 150 ms. W opublikowanym przez firmę zestawieniu Turbo miało wypadać szybciej od konkurencji (gdzie dla Cartesia Sonic 3.6 podano 262 ms, a dla OpenAI GPT-4o mini TTS – 814 ms). Należy jednak pamiętać, że są to wewnętrzne pomiary producenta, a rzeczywiste opóźnienie w środowiskach produkcyjnych zależy od infrastruktury sieciowej i konfiguracji całego systemu.