Bez kategorii

xAI wprowadza Grok Voice Transcribe 2.0. Trzykrotny spadek błędów w trudnych warunkach

xAI udostępniło Grok Voice Transcribe 2.0, nową wersję modelu do zamiany mowy na tekst, która koncentruje się na eliminacji błędów w najbardziej problematycznych nagraniach. Producent deklaruje, że w testach na krótkich frazach w 19 językach współczynnik błędów (WER) spadł z 20,6% do 6,8%. Choć testy porównawcze skupiały się na 19 językach, xAI deklaruje, że pełny zakres obsługiwanych języków w nowej wersji modelu obejmuje 25 pozycji. Mimo tak wyraźnej poprawy precyzji, cena za korzystanie z API nie uległa zmianie.

Odporność na szum i akcenty

Model został celowo wytrenowany na materiałach o niskiej jakości, aby skutecznie radzić sobie w warunkach, w których tradycyjne systemy transkrypcji często zawodzą. Grok Voice Transcribe 2.0 ma poprawnie przetwarzać mowę z zaszumionych linii telefonicznych, nagrania z nakładającymi się głosami wielu osób oraz wypowiedzi z silnymi lokalnymi akcentami. System potrafi również automatycznie wykrywać język i płynnie podążać za jego zmianami w obrębie jednego pliku audio.

Istotnym usprawnieniem jest precyzja w rozpoznawaniu dyktowanych danych, takich jak numery telefonów, adresy e-mail czy kwoty. Według deklaracji xAI, model zajmuje obecnie pierwsze miejsce w publicznym rankingu Artificial Analysis wśród 32 modeli streamingowych.

Możliwości API i wdrożenie

Dla deweloperów kluczową informacją jest brak konieczności zmian w kodzie przy przejściu na nową wersję. Elastyczność wdrożenia zapewnia szerokie spektrum obsługiwanych źródeł danych. Interfejs API pozwala na przetwarzanie nie tylko tradycyjnych zadań wsadowych i strumieni w czasie rzeczywistym, ale również na bezpośrednie przesyłanie plików audio oraz podawanie zewnętrznych adresów URL do materiałów dźwiękowych. Model 2.0 wprowadza szereg funkcji wspierających integrację:

  • Diaryzacja: rozpoznawanie poszczególnych mówców dostępne w standardowej cenie.
  • Wielokanałowość: obsługa do ośmiu kanałów audio jednocześnie.
  • Znaczniki czasu: obsługa precyzyjnych znaczników czasowych na poziomie poszczególnych słów, co ułatwia synchronizację tekstu z wideo lub dźwiękiem.
  • Biasing: możliwość zdefiniowania do 100 specjalistycznych terminów lub nazw własnych w celu poprawy celności.
  • Formatowanie: automatyczne czyszczenie tekstu z przerywników oraz ujednolicanie zapisu dat i walut.

Koszt usługi pozostaje na poziomie 0,10 USD za godzinę w trybie wsadowym (batch) oraz 0,20 USD za godzinę w przypadku strumieniowania w czasie rzeczywistym. xAI planuje wycofanie wersji 1.0 w ciągu najbliższych tygodni, zachowując jednak tymczasową możliwość wymuszenia korzystania ze starszego modelu dla systemów wymagających dłuższego okresu przejściowego.