OpenAI zaciera granice między kodowaniem a rozmową. Nowy tryb głosowy trafia do Codex
OpenAI intensyfikuje prace nad integracją swoich narzędzi, o czym świadczą najnowsze testy funkcji głosowych w czasie rzeczywistym wewnątrz aplikacji Codex. To, co początkowo wyglądało na prostą ciekawostkę w postaci animowanych „zwierzaków” (Pets) towarzyszących programistom, okazuje się poligonem doświadczalnym dla głębokiej zmiany technologicznej. Firma przygotowuje grunt pod debiut nowej architektury głosowej roboczo nazywanej GPT-Bidi-1, która porzuca model naprzemiennej rozmowy na rzecz pełnej dwukierunkowości.
Dlaczego to ważne właśnie teraz? OpenAI agresywnie łączy interfejsy głosowe, czatowe i programistyczne w jeden ekosystem. Ruch ten zbiega się w czasie z udokumentowaniem przez Microsoft nowych modeli audio, takich jak gpt-4o-transcribe, które obsługują sterowanie w czasie rzeczywistym i API dla strumieni audio na żywo. Codex nie jest już tylko edytorem; staje się centralnym punktem strategii voice-first AI.
Przełom w interakcji: Hej Chat zamiast komend
W najnowszej kompilacji Codexu pojawiły się parametry konfiguracyjne zmieniające sposób komunikacji z modelem. Użytkownicy mogą przypisać skróty klawiszowe oraz specjalną frazę wybudzającą „Hey Chat”. Wybór tego hasła zamiast nazwy „Codex” sugeruje, że OpenAI dąży do ujednolicenia usług. Coding agent i asystent ChatGPT stają się jedną powierzchnią interakcyjną. Jak podaje OpenAI: „Od teraz Codex daje do wyboru dwie osobowości: konkretną i pragmatyczną oraz bardziej konwersacyjną i empatyczną”.
Kluczową innowacją jest opcja pojedynczego tonu (single-tone), która pozwala przypisać sesję do trwałego wątku synchronizującego. Dla programisty oznacza to koniec rwanego kontekstu. Asystent głosowy zachowuje ciągłość informacji podczas całego procesu pisania kodu. Narzędzie potrafi już nawet edytować istniejące pull requesty, co drastycznie skraca czas mechanicznej pracy nad repozytorium.
Przemodelowana biblioteka i cicha konkurencja
Wizualne zmiany w panelu bocznym Codexu wprowadzają sekcję biblioteki identyczną z tą znaną z ChatGPT. Choć funkcja ta bywa jeszcze nieaktywna, głos staje się nadrzędnym interfejsem komunikacji. Już teraz w środowisku TUI można dyktować prompty poprzez przytrzymanie spacji. Codex jest obecnie dostępny dla płatnych użytkowników planów Pro, Enterprise i Team, a OpenAI zapowiada rozszerzenie dostępności na plany Plus i Edu w 2025 roku.
Ruchy te nie odbywają się w próżni. Anthropic wdraża wsparcie wielojęzyczne oraz tryb push-to-talk w modelu Claude. Wyścig o dominację w sferze Voice-First AI przyspiesza. Dokumentacja Azure OpenAI potwierdza, że dostęp do modeli audio przez interfejsy /audio i /realtime to nowa norma. Jeśli plotki o GPT-5.6 się potwierdzą, przyszły tydzień przyniesie fundamentalną zmianę w tym, jak rozumiemy współpracę z maszyną.
