Fizycy proponują wzór szacujący moment, w którym chatbot zaczyna generować szkodliwe odpowiedzi
Chatbot może przez dłuższy czas odpowiadać poprawnie, a po rozwinięciu wątku zacząć generować niebezpieczne instrukcje lub treści wprowadzające w błąd. Fizycy Neil Johnson i Frank Yingjie Huo z George Washington University przedstawili matematyczny wzór, który ma pomóc oszacować, jak długo model utrzyma pożądany kierunek wypowiedzi, zanim przejdzie do niepożądanej odpowiedzi.
Kluczową wielkością w równaniu jest n — liczba poprawnych tokenów wygenerowanych przed pierwszą szkodliwą odpowiedzią. Token to cząstka tekstu, na której operuje model. Jeżeli kontekst rozmowy od początku wymusza szkodliwą treść, wartość n wynosi zero. Jeśli jednak prompt sprzyja bezpiecznej odpowiedzi, model może przez pewien czas odpowiadać właściwie, dopóki nagromadzony kontekst nie przesunie prawdopodobieństwa w stronę niepożądanych sformułowań.
W opisywanych testach wzór prawidłowo rozróżnił natychmiastowe i opóźnione przejście do złej odpowiedzi w 15 z 16 jednoznacznych przypadków. Wynik ten nie oznacza jednak precyzyjnego przewidywania dokładnej treści ani bezwzględnego momentu każdej niebezpiecznej wypowiedzi — w próbach prognoza mogła różnić się o jeden token.
Zastosowanie w modelach działających offline
Autorzy widzą praktyczne zastosowanie wzoru przede wszystkim w modelach uruchamianych bezpośrednio na telefonach lub laptopach. W przeciwieństwie do dużych usług chmurowych, aplikacje działające lokalnie bez połączenia z siecią nie są na bieżąco weryfikowane przez zewnętrzne filtry bezpieczeństwa dostawcy. Badacze proponują, aby obok modelu działał lekki monitor, który na bieżąco obliczałby wartość n i ostrzegał, gdy przewidywany margines bezpieczeństwa spadnie poniżej ustalonego progu.
Jest to jednak na razie propozycja teoretyczna, a nie przetestowane wdrożenie. Dotychczasowe próby laboratoryjne opisane w preprincie objęły sześć modeli o otwartych wagach (o rozmiarze od 124 mln do 410 mln parametrów) oraz ograniczone okno kontekstu liczące 300 tokenów. Opublikowana wersja pracy rozszerza zestaw testowy do siedmiu modeli, w tym wariantu o wielkości do 12 mld parametrów, co nadal stanowi ułamek skali największych komercyjnych systemów AI.
W publikacji w „PNAS Nexus” autorzy zidentyfikowali opisywany mechanizm w obrębie pojedynczej „efektywnej głowy uwagi”, a nie całej sieci. To wynik tej pracy, który nie przesądza, że taki sam mechanizm odpowiada za zmianę zachowania we wszystkich współczesnych modelach.
Autorzy wskazują, że odpowiednie modyfikowanie promptu może oddalać moment przejścia, przesuwając wartość n poza oczekiwaną długość odpowiedzi. Ostateczna przydatność metody w długich, wielowątkowych rozmowach z użytkownikami pozostaje jednak kwestią otwartą i wymaga dalszych badań na większych architekturach.
