Google rzuca wyzwanie OpenAI w głosowym AI. Nowe modele Gemini są ponad dwukrotnie tańsze
Google DeepMind udostępniło programistom dwa nowe modele głosowe: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. Rozwiązania te są już dostępne za pośrednictwem Gemini API oraz Google AI Studio, oferując szerokie możliwości integracji w aplikacjach wymagających interakcji audio w czasie rzeczywistym.
Najważniejszym argumentem Google w starciu z OpenAI stała się cena. Oficjalne stawki za korzystanie z nowych modeli to 0,005 USD za minutę wejścia i 0,018 USD za minutę wyjścia. W praktyce godzina rozmowy z Gemini kosztuje około 1,38 USD. Dla porównania, stawka OpenAI za model GPT-Live-1 wynosi około 0,05 USD za minutę, co przekłada się na koszt blisko 3,00 USD za godzinę. Tak agresywna polityka cenowa stawia Google w pozycji faworyta dla deweloperów planujących masowe wdrożenia usług głosowych.
Multimodalność i wysokie wyniki w benchmarkach
Nowe modele nie ograniczają się wyłącznie do głosu. Ich architektura pozwala na jednoczesne prowadzenie konwersacji, przetwarzanie obrazu z kamery oraz wykonywanie wywołań API w tle. Modele wspierają ponad 97 języków, co czyni je gotowymi do globalnego użytku.
Pod względem jakości, wariant Extended Thinking odnotował bardzo dobry wynik w rankingu Artificial Analysis Speech-to-Speech Leaderboard, uzyskując 82,6%. Choć benchmark ten potwierdza wysoką sprawność technologiczną Google, warto zauważyć różnice w komforcie użytkowania. Dotychczasowe prezentacje sugerują, że OpenAI wciąż może utrzymywać przewagę w naturalności dialogu. Wynika to z pełnego dupleksu, który pozwala na płynniejsze przerywanie wypowiedzi i jednoczesne słuchanie oraz mówienie, co w przypadku modeli Gemini może wiązać się z nieco wyższą latencją lub mniej płynnym trybem komunikacji.
- Dostępność: Gemini API i Google AI Studio.
- Funkcje: Dialog głosowy, analiza wideo w czasie rzeczywistym, wywołań API w tle.
- Koszt: ~1,38 USD/godz. (Google) vs ~3,00 USD/godz. (OpenAI).
Decyzja Google o drastycznym obniżeniu progu wejścia może zmienić układ sił na rynku voice AI. Deweloperzy otrzymują narzędzie, które przy zbliżonych możliwościach technicznych i obsłudze niemal stu języków, oferuje znaczące oszczędności przy skalowaniu produktów.
