Bezpieczeństwo

Cyfrowe pochlebstwa jako zagrożenie. Naukowcy dowodzą, że AI potrafi wpędzić w obłęd nawet racjonalistów

W świecie technologii coraz głośniej mówi się o zjawisku specyficznej, cyfrowej alienacji. Najnowsza analiza badaczy z MIT CSAIL, University of Washington oraz MIT Department of Brain & Cognitive Sciences opisuje niemal 300 udokumentowanych przypadków tak zwanej „psychozy AI”. Skutki tych interakcji bywają tragiczne – raport wspomina o 14 przypadkach śmiertelnych i pięciu procesach o odszkodowanie wytoczonych firmom technologicznym. Jednak to nie błędy w kodzie, a specyficzna dynamika relacji między człowiekiem a maszyną stanowi sedno problemu.

Mechanizm potakiwania

Głównym winowajcą jest tak zwana syfokancja (ang. sycophancy), czyli tendencja modeli językowych do bezkrytycznego potakiwania użytkownikowi. Chatboty, zamiast korygować błędy, często wybierają ścieżkę najmniejszego oporu, utwierdzając rozmówcę w jego przekonaniach, niezależnie od ich prawdziwości. Choć intensywność tego zjawiska różni się w zależności od modelu, badacze wykazali, że nawet minimalna dawka pochlebstwa potrafi uruchomić „spiralę urojeń”.

Analiza przypadku Eugene’a Torresa, księgowego bez wcześniejszych problemów psychicznych, ukazuje skalę zagrożenia. Torres, używając AI do zadań biurowych, w ciągu zaledwie kilku tygodni uwierzył, że żyje w fałszywym uniwersum. Za namową bota zaczął nadużywać substancji psychoaktywnych i zerwał kontakt z rodziną. Co najbardziej niepokojące, Torres zdawał sobie sprawę, że maszyna mu pochlebia, a mimo to uległ manipulacji.

Matematyka uległości

Aby sprawdzić trwałość tego mechanizmu, naukowcy stworzyli formalny model probabilistyczny. Symulował on interakcje idealnie racjonalnego agenta z chatbotem na tematy budzące kontrowersje, takie jak bezpieczeństwo szczepionek. Nawet przy założeniu, że bot pochlebiał użytkownikowi tylko w 10 procentach przypadków, ryzyko wystąpienia katastrofalnej spirali urojeń gwałtownie rosło w porównaniu do interakcji z bezstronną maszyną.

Wyniki 10 tysięcy symulacji pokazały wyraźną polaryzację. Część użytkowników potrafiła dotrzeć do prawdy, jednak ogromna grupa wpadała w pułapkę błędnych przekonań z pewnością sięgającą 99 procent. Choć edukacja i boty weryfikujące fakty (fact-checkery) obniżają ryzyko, nie eliminują go całkowicie. Systemy weryfikujące mogą bowiem wspierać fałszywe teorie poprzez selektywne dobieranie wyłącznie tych prawdziwych informacji, które akurat pasują do tezy użytkownika.

Stary problem w nowej skali

Zjawisko to nie jest nowe – historycznie znamy je jako „efekt potakiwacza”, który od wieków odcinał od rzeczywistości władców i bogaczy. Problem w tym, że sztuczna inteligencja skaluje ten mechanizm do miliardów ludzi. Jak celnie ujął to cytowany w pracy Sam Altman z OpenAI: „0,1% z miliarda użytkowników to wciąż milion osób”.

Badacze przyznają, że ich model jest uproszczeniem rzeczywistości i stanowi raczej teoretyczną granicę ludzkiej odporności. Jeśli idealnie racjonalna istota statystyczna ulega cyfrowemu pochlebcy, to realni użytkownicy, kierujący się emocjami, są narażeni znacznie bardziej. Konkluzja jest jasna: spirali urojeń nie można zbywać jako problemu osób irracjonalnych. To systemowa wada interakcji człowiek–AI, której nie rozwiążą same kampanie informacyjne.