Koniec z „halucynacjami” na arXiv. Archiwum zapowiada rok banicji za niechlujne użycie AI
Strażnicy rzetelności w dobie LLM
arXiv, od dekad stanowiący fundament obiegu myśli naukowej w dziedzinie informatyki, matematyki i fizyki, przechodzi do ofensywy w walce z tzw. „AI slop”. Thomas Dietterich, przewodniczący sekcji informatyki w repozytorium, ogłosił wprowadzenie rygorystycznych sankcji dla badaczy, którzy przerzucają odpowiedzialność za treść publikacji na algorytmy. Zmiany nie zakazują samego korzystania ze sztucznej inteligencji, ale uderzają w brak nadzoru nad jej efektami.
Dowody nie do podważenia
Nowe wytyczne koncentrują się na przypadkach, w których dowody na bezmyślne kopiowanie z modeli językowych (LLM) są niepodważalne. Do katalogu „grzechów głównych” Dietterich zaliczył zmyślone bibliografie (tzw. halucynacje referencji) oraz pozostawione w tekście fragmenty promptów lub odpowiedzi bota, co świadczy o braku jakiejkolwiek redakcji autorskiej. Logika arXiv jest brutalna, ale spójna: jeśli autor nie zweryfikował nawet podstawowych błędów AI, cała zawartość publikacji staje się niewiarygodna.
Surowy model karania
Zastosowano zasadę „one-strike”. Jeśli moderatorzy wykryją rażące zaniedbania, autorzy zostaną objęci rocznym banem na publikowanie w serwisie. Po upływie kary ich powrót będzie obwarowany dodatkowym wymogiem: każda kolejna praca będzie musiała najpierw zostać zaakceptowana przez uznaną konferencję lub czasopismo recenzowane (peer-reviewed). Organizacja, która niedawno przekształciła się w niezależny podmiot non-profit, zyskuje w ten sposób narzędzia do ochrony swojej renomy jako źródła wysokiej jakości danych badawczych.
Odpowiedzialność spoczywa na człowieku
Decyzja arXiv to sygnał dla całego środowiska naukowego. Choć badania biomedyczne i techniczne coraz częściej borykają się z plagą sfabrykowanych cytowań, repozytorium przypomina, że narzędzie nie może być wymówką. Autorzy ponoszą pełną odpowiedzialność za tekst – niezależnie od tego, czy zawiera on błędy merytoryczne, stronniczość, czy plagiat – nawet jeśli ich źródłem był model językowy. Przy rosnącej presji na liczbę publikacji, arXiv wybiera drogę ochrony jakości, stawiając barierę dla naukowej bylejakości napędzanej przez automatyzację.
