Agenci AI zaczynają sami się odzywać. Trudniej będzie ustalić, kiedy powinni milczeć
Meta, OpenAI i Uber rozwijają narzędzia, które nie tylko czekają na pytania, ale same inicjują kontakt z użytkownikiem. Taki model działania stawia przed twórcami nowe wyzwanie projektowe: system musi najpierw ocenić, czy dana sprawa w ogóle uzasadnia odrywanie człowieka od zajęcia, kiedy najlepiej to zrobić i jaki kanał komunikacji wybrać — jeszcze zanim wygeneruje treść wiadomości.
Meta zaprezentowała asystenta Muse, który ma działać w tle również po zamknięciu aplikacji, rezerwować usługi i proponować działania bez bezpośredniej prośby, pytając o zgodę przed ich wykonaniem. Kontakt z nim może odbywać się w dedykowanej aplikacji oraz przez WhatsApp. OpenAI opisało rozwiązanie Dots — agentów prowadzących proaktywne analizy i monitorujących połączone narzędzia w trybie do odczytu, na przykład w poszukiwaniu zapomnianej faktury lub przeoczonego wątku na Slacku. Z kolei Uber przedstawił asystenta doradzającego kierowcom na podstawie sytuacji na rynku: w jednym z opisywanych przykładów system po 33 minutach bezczynności kierowcy sam wskazał strefę z większym popytem i wyjaśnił powody tej rekomendacji.
Koszt przerwania uwagi
Klasyczny chatbot reaguje wyłącznie wtedy, gdy to człowiek wybierze moment i zada pytanie. Agent proaktywny odwraca tę dynamikę. Zbyt częsty kontakt grozi irytacją i wyciszeniem powiadomień przez użytkownika, a kontakt spóźniony sprawia, że informacja traci wartość — na przykład gdy przepadnie szansa na zlecenie albo upłynie termin płatności.
Sam model językowy potrafi zredagować naturalnie brzmiącą wiadomość, ale niekoniecznie powinien decydować o tym, czy ją wysłać. Każde powiadomienie wiąże się z kosztem poznawczym dla odbiorcy. Aby kontakt miał sens, przewidywana korzyść musi ten koszt przewyższać. Znaczenie mają tu cztery czynniki: waga sprawy, jej pilność, prawdopodobieństwo, że użytkownik zareaguje, oraz koszt wybranego kanału. Niewielka podpowiedź może trafić na cichą kartę w aplikacji, ważniejsza sprawa na czat, a bezpośrednie powiadomienie lub komunikat głosowy powinny być zarezerwowane dla sytuacji krytycznych czasowo.
Decyzja przed generowaniem tekstu
W roli filtrów decyzyjnych sprawdzić się mogą wyspecjalizowane modele, które zamiast tekstu zwracają binarny werdykt lub ocenę punktową. Przykładami takich architektur są Jev czy Julia 1; według deklaracji twórców tej drugiej model działa na procesorze CPU i podejmuje decyzję w czasie około 33 milisekund. Lekki system tego typu mógłby oceniać setki potencjalnych zdarzeń w tle, decydując, które z nich odrzucić, które odłożyć do zbiorczego podsumowania, a które przekazać od razu do modelu językowego w celu sformułowania wiadomości.
Takie modele decyzyjne mają jednak swoje ograniczenia: oceniają wyłącznie dane i kontekst, które bezpośrednio im dostarczono, bez wbudowanej wiedzy o indywidualnych preferencjach użytkownika, o ile nie zostaną one uwzględnione w parametrach wejściowych. Odrębną kwestią pozostaje także charakter samych komunikatów — jeśli proaktywność zacznie służyć głównie celom promocyjnym lub handlowym zamiast rzeczywistej pomocy, użytkownicy szybko stracą zaufanie do rekomendacji agenta również w codziennych zadaniach.
