Google pozwala projektować głosy za pomocą opisu tekstowego. Nowe modele Gemini trafiły do API
Gemini 3.8 Flash TTS umożliwia tworzenie profili głosowych na podstawie promptu tekstowego lub 30-sekundowej próbki, do której dołączono nagraną zgodę. Wariant Flash-Lite ma z kolei obniżyć koszty generowania mowy na dużą skalę.
Read More