Cohere rzuca wyzwanie OpenAI. Nowy model Transcribe Arabic i English wyznacza standardy
Kiedy OpenAI zdominowało rynek transkrypcji modelem Whisper, wydawało się, że konkurencja potrzebuje lat, by nadrobić dystans. Tymczasem w marcu 2026 roku Cohere wypuściło Transcribe-03-2026 – otwartoźródłowy model o architekturze 2 miliardów parametrów, który na wstępie zajął pierwsze miejsce na Open ASR Leaderboard dla języka angielskiego, wyprzedzając zarówno rozwiązania komercyjne, jak i społecznościowe.
To wydarzenie zmienia układ sił na rynku audio-to-text. Wykorzystując model Transcribe, firmy otrzymują narzędzie, które osiąga średni błąd słowa (WER) na poziomie zaledwie 5,42% w testach benchmarkowych. Jak podkreśla Cohere Research Team na Hugging Face: „Ten dedykowany model transkrypcyjny został wyszkolony od zera, aby wspierać 14 kluczowych języków biznesowych, osiągając najnowocześniejszą precyzję przy zachowaniu wysokiej wydajności”.
Przełom w technologii ASR dla Bliskiego Wschodu
Model Cohere to nie tylko cyfry w tabelach, ale przede wszystkim odpowiedź na lingwistyczne pułapki świata arabskiego. Rozwiązuje on problemy, z którymi tradycyjne systemy speech-to-text radziły sobie ze zmiennym szczęściem: ogromną różnorodność dialektów oraz zjawisko przełączania kodu (code-switching). Użytkownicy w regionie często płynnie przechodzą między arabskim a angielskim w jednym zdaniu – Transcribe Arabic radzi sobie z tym bez utraty kontekstu.
Szybkość, która deklasuje konkurencję
Nowa architektura przewyższa rynkowy standard – Whisper Large V3 – nie tylko precyzją, ale przede wszystkim tempem pracy. Transcribe oferuje trzykrotnie wyższą przepustowość (throughput) w trybie offline niż modele o podobnej wielkości. W praktyce oznacza to, że system przetwarza około 60 sekund nagrania audio w zaledwie jedną sekundę. To czyni go idealnym narzędziem do masowej transkrypcji archiwów czy analizy połączeń w centrach obsługi klienta w czasie rzeczywistym.
Dostępność i brakujące funkcje
Decyzja o udostępnieniu wag modelu na otwartej licencji Apache 2.0 to uderzenie w zamknięte systemy gigantów. Model jest już dostępny na platformie Hugging Face oraz poprzez API Cohere. Nie jest to jednak narzędzie bez wad. W obecnej wersji brakuje funkcji diarizacji (rozpoznawania, kto mówi), znaczników czasowych (timestamps) oraz automatycznego wykrywania języka. Co więcej, przy dłuższych momentach ciszy model może generować nieistniejący tekst. To surowy, niesamowicie szybki silnik transkrypcyjny, który wymaga dodatkowej obróbki programistycznej, by zastąpić pełne pakiety biurowe.
