LLM

Odpowiedzi chatbotów są mniej zróżnicowane niż wyniki w Google. Wnioski z badania 27 modeli AI

Odpowiedzi generowane przez chatboty AI są wyraźnie bardziej ujednolicone niż informacje, do których prowadzi tradycyjna wyszukiwarka Google — wynika z pracy naukowców z Uniwersytetu Kopenhaskiego. W analizowanych zagadnieniach nawet GPT-5, który wypadł najlepiej spośród testowanych systemów, dostarczał co najmniej o 18,7 proc. mniej zróżnicowanych informacji niż klasyczne wyniki wyszukiwania.

Badanie objęło 27 modeli językowych, 155 tematów oraz dane odnoszące się do 12 krajów. Dla każdego zagadnienia naukowcy przygotowali po 200 wariantów zapytań wzorowanych na pytaniach rzeczywistych użytkowników, co przełożyło się na analizę około 70 milionów wygenerowanych stwierdzeń. Pytania dotyczyły m.in. zagadnień społecznych, politycznych i kulturowych, takich jak broń jądrowa, relacje międzynarodowe czy zjawiska popkulturowe.

We wszystkich badanych przypadkach odpowiedzi chatbotów cechowały się mniejszą różnorodnością perspektyw niż wyniki wyszukiwania Google. Dustin Wright z Uniwersytetu w Aalborgu, główny autor publikacji, zwraca uwagę, że osoby korzystające z asystentów AI jako głównego źródła wiedzy mogą regularnie trafiać na te same, powtarzalne ujęcia danego tematu.

Różnorodność to nie to samo co poprawność

Autorzy eksperymentu wyraźnie zaznaczają, że pomiar dotyczył wyłącznie stopnia zróżnicowania dostarczanych treści, a nie ich poprawności merytorycznej, wiarygodności czy logicznej spójności. Modele językowe z założenia opierają się na statystycznych wzorcach wyuczonych na podstawie ogromnych korpusów tekstu. W efekcie ich odpowiedzi naturalnie grawitują w stronę dominujących narracji, podczas gdy mniej popularne punkty widzenia lub rzadsze fakty są pomijane.

W pracy opisano również hipotetyczny mechanizm tzw. „załamania wiedzy” (knowledge collapse). Do takiego scenariusza mogłoby dojść w sytuacji, gdy kolejne generacje modeli będą w dużej mierze trenowane na materiałach tworzonych przez wcześniejszą generatywną sztuczną inteligencję. Jeśli generowane treści staną się węższe, zasób informacji w modelach mógłby z czasem ulegać stopniowej degradacji.

Badacze podkreślają jednak, że to ostrzeżenie przed potencjalnym ryzykiem, a nie diagnoza obecnego stanu rzeczy. Z danych wynika wręcz, że nowsze modele radzą sobie z zachowaniem różnorodności nieco lepiej od swoich poprzedników. Opracowana w ramach projektu metoda pomiaru ma pomóc twórcom sztucznej inteligencji uwzględniać ten czynnik przy dalszym trenowaniu systemów.

Publikacja opisująca wyniki badania ukazała się wstępnie w repozytorium arXiv, a artykuł został przyjęty do prezentacji na konferencji EMNLP 2026.