Audio

OpenAI odświeża ofertę transkrypcji: szybciej i taniej, ale wciąż za plecami liderów

OpenAI rzuca wyzwanie rynkowi audio, choć liczby pokazują, że firma Sama Altmana wciąż goni uciekającą czołówkę. Wprowadzenie modeli gpt-4o-transcribe oraz gpt-4o-mini-transcribe to strategia oparta na masowości i niskich kosztach, a nie na bezdyskusyjnej dominacji technologicznej. Wyścig o to, kto najlepiej „słyszy” ludzki głos, nabiera tempa, bo deweloperzy szukają rozwiązań, które nie tylko zrozumieją specjalistyczny żargon, ale i nie zrujnują budżetu przy dużej skali.

Ewolucja zamiast rewolucji

OpenAI wprowadziło do swojej oferty dwa główne modele rozpoznawania mowy oraz mechanizm GPT-Realtime-Whisper. Ten ostatni to system strumieniowy, który „transkrybuje mowę na żywo” – jak informuje zespół OpenAI. Rozwiązanie to zoptymalizowano pod kątem minimalnych opóźnień, co jest niezbędne w botach telefonicznych czy asystentach głosowych. Z kolei wariant dedykowany plikom audio potrafi przetwarzać nagrania 34 razy szybciej niż trwa ich odtworzenie.

Poprawa precyzji w cieniu konkurencji

Nowe rozwiązania przynoszą wymierny postęp. Według benchmarku AA-WER, model gpt-4o-transcribe osiągnął współczynnik błędów (WER) na poziomie 3,31%. To wynik o 0,7 punktu procentowego lepszy niż w przypadku rocznego poprzednika. Mimo odczuwalnej poprawy, OpenAI nie wskoczyło na podium. Palmę pierwszeństwa wciąż dzierży ElevenLabs z modelem Scribe v2, który notuje błąd na poziomie zaledwie 2,3%. Lepiej radzą sobie także Google Gemini 3 Pro (2,9%) oraz model Voxtral Small od Mistral (3%).

Agresywna walka o portfele deweloperów

Równolegle z poprawą jakości, OpenAI zdecydowało się na radykalne cięcie kosztów. Cena za minutę transkrypcji spadła o 25%, osiągając poziom 0,0045 dolara. Firma chce konkurować opłacalnością, jednak nawet tutaj konkurencja naciska mocniej. Europejski Mistral oferuje swój model Voxtral Transcribe V2 w cenie 0,003 dolara za minutę, co czyni go znacznie tańszą alternatywą dla masowych zastosowań.

Funkcjonalność i infrastruktura

Nowe modele wspierają wiele języków i pozwalają na wprowadzanie kontekstu tekstowego oraz słów kluczowych. Ułatwia to poprawny zapis nazwisk czy terminologii medycznej. Całość stanowi element szerszej infrastruktury Realtime, do której dołączył wspomniany GPT-Realtime-Whisper. OpenAI buduje spójne środowisko dla mowy, licząc, że wygoda integracji przeważy nad nieco gorszymi wynikami w testach dokładności oferowanymi przez wyspecjalizowanych konkurentów.