Dialog-RSN-1: Koniec z głuchym telefonem na infoliniach. PolyAI stawia na natywne audio
Większość systemów głosowych AI, które spotykamy na infoliniach, działa w oparciu o przestarzałą architekturę kaskadową. Jeden model słucha i mozolnie przepisuje dźwięk na tekst, a drugi analizuje te notatki, by wygenerować odpowiedź. Ten proces przypomina zabawę w głuchy telefon – w trakcie transkrypcji bezpowrotnie giną emocje, wahania w głosie oraz kluczowe pauzy. PolyAI zamierza to zmienić, wprowadzając Dialog-RSN-1 – model natywny dla dźwięku, który zamiast czytać transkrypcję, po prostu słyszy rozmówcę.
Dlaczego to ważne właśnie teraz? Tradycyjne voiceboty utknęły w pułapce opóźnień i błędów wynikających z warstwy ASR (rozpoznawania mowy). Nowy model od PolyAI eliminuje te bariery, łącząc rozpoznawanie dźwięku, logikę biznesową i planowanie odpowiedzi w jeden, spójny proces. To reakcja na rosnącą frustrację klientów, którzy w rozmowie z maszyną wciąż muszą mierzyć się z nienaturalnymi pauzami i brakiem zrozumienia kontekstu akustycznego.
Słuchanie zamiast czytania notatek
Jak podaje PolyAI, model Dialog-RSN-1 postrzega audio dzwoniącego bezpośrednio, bez pośrednictwa tekstu. Pozwala to na wychwycenie niuansów, których czysty zapis nie jest w stanie oddać. Co istotne, firma nie zdecydowała się na pełny model speech-to-speech, w którym również głos wyjściowy jest generowany przez sieć neuronową. Zamiast tego, wyjście audio obsługuje dedykowany system TTS. Daje to korporacjom pełną kontrolę nad brzmieniem asystenta, eliminując ryzyko niekontrolowanych zmian w akcencie, co bywa zmorą rozwiązań typu GPT Realtime.
Walka o milisekundy
W biznesie opóźnienie zabija naturalność. Dialog-RSN-1 osiąga czas odpowiedzi poniżej 300 ms, co czyni interakcję niemal nieodróżnialną od rozmowy z człowiekiem. Inżynierowie osiągnęli to dzięki optymalizacji tzw. turn-taking, czyli płynnego przejmowania głosu. Helen Greul z PolyAI zauważa, że w tym systemie „przejmowanie głosu jest dosłownie jego pierwszym tokenem wyjściowym”. Model najpierw decyduje, czy użytkownik skończył mówić, a dopiero potem angażuje zasoby do generowania treści, co drastycznie oszczędza moc obliczeniową GPU.
Skok wydajności w ubezpieczeniach i gastro
Dane z pierwszych wdrożeń pokazują, że nie mamy do czynienia jedynie z technologiczną ciekawostką. W sektorze ubezpieczeniowym odnotowano spadek opóźnień o 37%, a w dużej sieci restauracyjnej wskaźnik samodzielnego rozwiązywania spraw przez klientów wzrósł o 11%. Obecnie system obsługuje wyłącznie język angielski i jest dostępny dla dużych graczy z sektorów finansowego i telekomunikacyjnego. Choć PolyAI nie planuje na razie udostępnienia wag modelu (open weights) ani publicznego API, firma zapowiedziała publikację benchmarku Dialog-Eval, który ma ustandaryzować ocenę modeli głosowych działających w czasie rzeczywistym.
