Bez kategorii

Gander od Tencent: lepszy timing rozmowy za cenę dokładności zadań — Portal Technologiczny i AI

Współczesne systemy AI zazwyczaj działają w trybie naprzemiennym: użytkownik kończy mówić, a model dopiero wtedy zaczyna generować odpowiedź. Zespół Tencent Hunyuan Speech wraz z partnerami akademickimi opublikował raport techniczny dotyczący modelu Gander, który próbuje przełamać ten schemat. System potrafi jednocześnie słuchać, analizować obraz i tekst oraz wykonywać zadania agentowe w tle, nie przerywając interakcji z człowiekiem.

Kluczem do działania Gandera jest architektura inspirowana ludzką anatomią, która rozdziela procesy na dwa moduły:

  • Cerebellum (móżdżek): Odpowiada za dynamikę rozmowy w skali milisekund. To on decyduje, kiedy model powinien słuchać, a kiedy wtrącić słowo, co pozwala użytkownikowi na swobodne przerywanie wypowiedzi asystenta.
  • Brain (mózg): Wymienny komponent zajmujący się logiką i ciężką pracą analityczną. Co istotne, moduł ten można podmienić na inne systemy, takie jak Codex czy Claude Code, bez konieczności ponownego trenowania warstwy konwersacyjnej. W testach badacze wykorzystali nieokreślony model z rodziny GPT-5.6.

W benchmarku Full-Duplex-Bench v3, oceniającym naturalność interakcji, Gander wykazał się wzorcowym wyczuciem czasu we wszystkich 100 scenariuszach. Model przerywał użytkownikowi w niewłaściwym momencie jedynie w 8% przypadków. Dla porównania, system GPT-Realtime robił to w 13,5% sytuacji, a najsłabsi konkurenci wchodzili w słowo niemal w połowie prób (48%).

Kompromis między płynnością a precyzją

Mimo sukcesów w warstwie konwersacyjnej, raport wskazuje na wyraźną cenę tej płynności. Gander wypada słabiej od rywali pod względem dokładności wykonywanych zadań. Badacze częściowo tłumaczą to błędami w rozpoznawaniu mowy (ASR), które pogarszają wynik całego systemu, choć sam moduł „mózgu” w trybie tekstowym radzi sobie znacznie lepiej.

Dodatkowym wyzwaniem okazała się percepcja. Zdolność modelu do rozumienia wideo i obrazu uległa pogorszeniu względem wersji bazowej. Autorzy raportu przyznają, że intensywny trening nastawiony na płynną rozmowę osłabił zdolności poznawcze modelu, takie jak precyzyjne liczenie czy lokalizowanie obiektów na nagraniach.

Gander był trenowany na zbiorze 2,7 mln przykładów, obejmującym również sytuacje, w których system musi zachować milczenie – na przykład przy hałasie w tle lub gdy nikt z grupy nie zwraca się bezpośrednio do niego. Tencent udostępnił już demo oraz repozytorium projektu, a po zakończeniu procedur publikacyjnych planuje opublikować wagi modelu oraz dane treningowe na zasadach open source.