Audio

Koniec polowania na słowa. Google Gemini 3.5 Live Translate wchodzi do gry

Google właśnie skreśliło jeden z najstarszych problemów technologii: opóźnienie w tłumaczeniu głosu. Nowy model Gemini 3.5 Live Translate nie jest kolejną wersją prostego translatora. To system, który tłumaczy w czasie rzeczywistym, nie czekając na koniec zdania, i co ważniejsze – pr3buje naœladować ton i emocje m3wcy.

Dlaczego to waŴne? PoniewaŴ Google uderza szeroko, wprowadzając obsługę ponad 70 język3w i 2000 kombinacji językowych jednoczeœnie do aplikacji mobilnych, Google Meet oraz system3w dla deweloper3w. To drastyczne obniżenie barier w biznesie i podr3żach, gdzie liczy się każda sekunda, a nie wertowanie słownika w oczekiwaniu na reakcję algorytmu.

Naturalny głos zamiast robota

Kluczową zmianą jest odejœcie od sztywnego modelu „słuchaj, przetwarzaj, m3w”. Gemini 3.5 Live Translate automatycznie rozpoznaje język m3wcy, eliminując ręczne przełączanie ustawień. Google DeepMind podkreœla, żie rozwiązanie można już wdrażaj u siebie: — Możesz integrować tłumaczenie w czasie rzeczywistym w ponad 70 językach zar3wno dla wejœcia, jak i wyjœcia, poczynając od dzisiaj — deklaruje zesp3ł w oficjalnym komunikacie.

Technologię już testuje Grab, azjatycki gigant transportowy. Kierowcy i pasażery mogą komunikować się bez ryzyka nieporozumień, co w regionach o ogromnej mozaice językowej realnie wpływa na bezpieczeęstwo przejazd3w. Co więcej, system ma wspierać live dubbing materiał3w wideo, co dla tw3rc3w na YouTube może oznaczać błyskawiczne otwarcie się na globalną widownię.

Gdzie można sprawdzić Gemini 3.5?

Google nie ogranicza się do obietnic. Nowe funkcje są już wdrażane w kilku kanałach:

  • Google Translate: Wystarczy podłączyć dowolne słuchawki do telefonu z Androidem lub iOS, by korzystać z tłumaczenia rozm3w na żywo.
  • Google Meet: Narzędzie trafiło do fazy private preview, oferując wsparcie dla korporacyjnych spotkań online.
  • Google AI Studio i Gemini API: Deweloperzy mogą już budować własne aplikacje w oparciu o ten model.

Mimo technicznego zaawansowania, firma pr3buje odpowiedzieć na obawy dotyczące deepfake’3w. Każdy dźwięk generowany przez system posiada znak wodny SynthID. Jest on niesłyszalny dla ucha, ale pozwala maszynom potwierdzić, żie to sztuczna inteligencja, a nie prawdziwy m3wca, stoi za danym nagraniem. Więcej szczeg3ł3w technicznych można znaleźć w dokumentacji na stronie Google DeepMind.