Audio

Lokalny TTS bez kompromisów: Supertone wypuszcza Supertonic V3

Koniec z uzależnieniem od chmury

Prywatność danych i niskie opóźnienia to obecnie największe wyzwania dla interfejsów głosowych. Supertone rzuciło wyzwanie gigantom, wypuszczając Supertonic V3 – model Text-To-Speech, który udowadnia, że potężna synteza mowy nie wymaga farm serwerów A100 ani gigantycznych wag rzędu miliardów parametrów.

V3 to nie jest kosmetyczna poprawka. To brutalna optymalizacja.

Zamiast polegać na ciężkich modelach dyfuzyjnych, Supertone wykorzystuje Flow Matching. Efekt? System potrzebuje zaledwie dwóch kroków inferencji, aby wygenerować wysokiej jakości audio. W praktyce oznacza to, że synteza dzieje się szybciej niż w czasie rzeczywistym, nawet na czytnikach e-booków z procesorami o niskim poborze mocy.

31 języków i polska normalizacja tekstowa

Największym skokiem względem poprzedniej wersji jest zasięg lingwistyczny. Supertonic V2 obsługiwał zaledwie pięć języków; wersja trzecia wspiera ich aż 31, w tym język polski. Co istotne dla deweloperów, model natywnie radzi sobie z normalizacją tekstu, co jest piętą achillesową rozwiązań od OpenAI czy Microsoftu.

Dlaczego to ma znaczenie?

Większość systemów TTS „wykłada się” na prostych zapisach: kwotach walut, numerach telefonów czy jednostkach technicznych. Supertonic V3 bez dodatkowego przetwarzania wstępnego poprawnie przeczyta „$5.2M” jako „five point two million dollars” oraz „30kph” jako „thirty kilometers per hour”. Rywale, tacy jak ElevenLabs Flash czy Gemini Flash, często zawodzą w tych specyficznych scenariuszach.

Głos z emocjami wbudowany w znaczniki

Nowością są Expressive Tags. Teraz deweloperzy mogą wstrzykiwać ludzkie odruchy bezpośrednio do ciągu tekstowego:

  • <laugh> – naturalnie brzmiący śmiech wpleciony w zdanie.
  • <breath> – pauzy na oddech, które rozbijają syntetyczną monotonię.
  • <sigh> – westchnienia nadające wypowiedzi kontekst emocjonalny.

Wszystko to dzieje się wewnątrz jednego modelu, bez konieczności angażowania osobnych modułów prozodycznych.

Lekka inżynieria: 404 MB i brak GPU

Pod maską Supertonic V3 kryje się zaledwie 99 milionów parametrów. Cały pakiet ONNX zajmuje 404 MB na dysku. To „śmiesznie” mało w porównaniu do modeli klasy 0.7B – 2B, które dominują w środowisku open-source.

Mobilność to klucz.

Brak zależności od GPU sprawia, że wdrożenie lokalne w przeglądarce (przez WebGPU/WASM), na smartfonie czy w aplikacji desktopowej staje się trywialne. Architektura wykorzystuje LARoPE (Length-Aware Rotary Position Embedding), co drastycznie redukuje błędy pomijania słów lub ich zapętlania, które nękały wersję V2.

Jak zacząć?

Implementacja sprowadza się do kilku linii w Pythonie. Wystarczy proste pip install supertonic. SDK automatycznie pobiera wagi z Hugging Face przy pierwszym uruchomieniu, a potem działa całkowicie offline.

Supertone udostępniło kod na licencji MIT, co czyni V3 jednym z najciekawszych narzędzi dla twórców gier, aplikacji mobilnych i systemów wspomagających dostępność, którzy szukają wydajności bez oddawania kontroli nad danymi zewnętrznym dostawcom.