Audio

Google pozwala projektować głosy za pomocą opisu tekstowego. Nowe modele Gemini trafiły do API

Google udostępniło dwa nowe modele syntezy mowy: Gemini 3.8 Flash TTS oraz Flash-Lite TTS. Pierwszy z nich służy do projektowania brzmienia i ekspresji w projektach kreatywnych, takich jak podcasty czy postacie w grach. Drugi został zoptymalizowany pod kątem tańszego generowania audio na dużą skalę, na przykład na potrzeby dubbingu czy agentów głosowych. Oba systemy obsługują ponad 100 języków i pozwalają precyzyjnie kontrolować sposób wypowiedzi.

Głos z opisu lub 30-sekundowej próbki

W modelu Flash TTS profil głosu można stworzyć bezpośrednio za pomocą promptu, opisując rolę, akcent oraz cechy barwy. Alternatywą jest wybór spośród ponad 2000 gotowych wariantów z biblioteki Google lub wygenerowanie profilu na podstawie 30-sekundowego nagrania referencyjnego. W tym ostatnim przypadku Google wymaga dołączenia oświadczenia o zgodzie na klonowanie, wypowiedzianego przez tę samą osobę, do której należy nagrany głos.

Firma zapowiedziała również funkcję Voice Remixing, która w przyszłości ma umożliwić modyfikowanie tempa, wysokości, barwy oraz akcentu gotowych głosów z katalogu. Wszystkie pliki generowane przez modele audio Gemini są oznaczane niewidocznym dla ucha znakiem wodnym SynthID.

Dialogi, reakcje i kontrola nad tekstem

Oba modele pozwalają przypisywać szczegółowe instrukcje interpretacyjne pojedynczym kwestiom w scenariuszu. Narzędzie obsługuje także tryb dialogu, w którym z jednego tekstu generowana jest rozmowa dwóch postaci o odrębnych głosach. W skrypcie można również zaplanować reakcje niewerbalne, takie jak śmiech, westchnienie czy pauzy.

Możliwości te niosą jednak pewne ograniczenia. Wstępne próby odsłuchowe wykazały, że choć instrukcje stylu pozwalają uzyskać naturalną intonację i akcent, w wygenerowanym materiale mogą pojawiać się artefakty dźwiękowe w tle, a w dłuższych fragmentach zdarzają się zauważalne zmiany barwy głosu. Opisane próby obejmowały jednak tylko dwie próbki, więc nie pozwalają ocenić, jak często występują te problemy — w jednym z nagrań głos zmienił się pod koniec, a w tle pojawił się wysoki dźwięk.

Koszty generowania audio

Nowe modele są dostępne w Google AI Studio oraz przez Gemini API. Google deklaruje, że dane przesyłane w ramach płatnych planów nie są wykorzystywane do trenowania modeli.

Rozliczenie opiera się na tokenach: sekunda wyjściowego dźwięku odpowiada 25 tokenom, co daje 90 tysięcy tokenów za godzinę nagrania. Do końca 2026 roku godzina wygenerowanego audio kosztuje 0,81 dolara w przypadku Flash TTS oraz 0,54 dolara w wersji Flash-Lite (od 2027 roku stawki wzrosną odpowiednio do 1,62 i 1,08 dolara). Należy pamiętać, że podany koszt dotyczy wyłącznie generowanego dźwięku — tekst wprowadzany na wejściu jest rozliczany osobno.