Audio

Google naprawia Twoje błędy, zanim skończysz mówić. Gemini 3.5 Transcribe wchodzi do gry

Google właśnie podniosło poprzeczkę w wyścigu na rozpoznawanie mowy. Zamiast surowego zapisu każdego dźwięku, Gemini 3.5 Transcribe dostarcza tekst, który wygląda, jakby wyszedł spod pióra redaktora. Nowy system nie tylko słucha, ale aktywnie porządkuje wypowiedzi: wyrzuca zbędne „yyy” oraz „eee”, poprawia przejęzyczenia i wygładza błędy składniowe w locie. To koniec ery dyktowania, po którym trzeba spędzić kwadrans na usuwaniu śmieciowych wyrazów z notatki.

Dlaczego to ważne właśnie teraz?

Premiera Gemini 3.5 Transcribe wpisuje się w trend zastępowania prostych narzędzi audio przez systemy rozumiejące kontekst. Google pozycjonuje nowość jako swój najbardziej precyzyjny model mowy do tej pory. W rzeczywistości, w której spotkania online i notatki głosowe zdominowały pracę zdalną, subsekundowa latencja oraz wsparcie dla ponad 85 języków stają się fundamentem wydajności, a nie tylko technologiczną ciekawostką.

Prędkość bez kompromisów

Pod maską zaszły drastyczne zmiany. Inżynierowie z Mountain View zredukowali opóźnienia aż o 70 procent w porównaniu do starszego modelu Chirp 3. Tak niska latencja sprawia, że transkrypcja na żywo dogania tempo naturalnej rozmowy. Liczby mówią same za siebie: współczynnik błędów (WER) spadł do poziomu 4,0 proc. dla streamingu, a w przypadku gotowych plików audio wynosi zaledwie 2,6 proc. To wynik, który stawia Google w ścisłej czołówce, wyprzedzając wiele niszowych rozwiązań do stenotypii.

Dwa oblicza inteligencji

Gigant udostępnił dwa osobne interfejsy programistyczne. Pierwszy z nich, gemini-3.5-transcribe-live, służy do błyskawicznego przetwarzania dźwięku w czasie rzeczywistym. Drugi, gemini-3.5-transcribe, stworzono z myślą o analizie gotowych plików. Ten ostatni oferuje zaawansowany speaker diarization, czyli funkcję rozpoznawania tego, który z rozmówców wypowiada dane słowa, oraz precyzyjne znaczniki czasu. Ciekawie wygląda też funkcja „function calling” – jeśli podczas dyktowania wydasz polecenie wygenerowania obrazu, system przekaże to zadanie odpowiedniemu modułowi Gemini.

Gdzie można to przetestować?

Technologia opuściła już laboratoria i trafiła do publicznego podglądu (public preview). Programiści znajdą ją w Google AI Studio oraz na platformie Gemini Enterprise Agent. Zwykli użytkownicy mogą szukać śladów nowej mocy w aplikacji Gboard na Androida (ukrytej pod kodową nazwą „Rambler”) oraz w wersji Gemini na system macOS. Wkrótce model trafi też bezpośrednio do przeglądarki Chrome, co ma ostatecznie wyeliminować potrzebę instalowania zewnętrznych wtyczek do transkrypcji spotkań.