Eksperci dawali AI kilka procent szans na matematyczne złoto. Poziom olimpijski nadszedł lata wcześniej
W 2022 roku uczestnicy badania Longitudinal Expert AI Panel (LEAP) szacowali, kiedy systemy sztucznej inteligencji osiągną poziom pozwalający uzyskiwać wyniki na miarę złotego medalisty Międzynarodowej Olimpiady Matematycznej. Mediana wskazań ekspertów wyznaczała ten moment na 2030 rok, a tak zwanych superprognostyków — na 2035 rok. Wynik ten udało się jednak uzyskać w specjalnie przygotowanym benchmarku w lipcu 2025 roku.
Skalę zaskoczenia dobrze obrazują przypisywane wówczas prawdopodobieństwa. Eksperci oceniali średnio na 8,6 proc. szanse, że poziom olimpijski zostanie osiągnięty przed przewidzianym terminem, podczas gdy superprognostycy szacowali je na zaledwie 2,3 proc. W pierwszej rundzie panelu LEAP wzięło udział 339 osób, w tym informatycy, badacze reprezentujący sektor komercyjny, ekonomiści oraz specjaliści zajmujący się regulacjami AI.
Z opublikowanej przez Forecasting Research Institute (FRI) wstępnej oceny wynika, że podobna rozbieżność wystąpiła również w innych testach technicznych. W przypadku zaawansowanego benchmarku z zakresu wirusologii eksperci spodziewali się przełomu w 2030 roku, a superprognostycy w 2034 roku. Z analizy FRI wynika tymczasem, że wymagany próg został osiągnięty prawdopodobnie już w kwietniu 2025 roku. Ogółem eksperci przypisywali wcześniej średnio 24,6 proc. szans wynikom, które modele faktycznie uzyskały w sprawdzanych testach możliwości, a superprognostycy — 9,7 proc.
Szybsze niż zakładano tempo odnotowano także w obszarze komercyjnym. Mediana przewidywań panelu dotycząca rocznych przychodów czołowych firm z sektora wynosiła 20 mld dolarów, podczas gdy raport FRI wskazuje szacunki dla firmy Anthropic sięgające około 100 mld dolarów przychodów w ujęciu rocznym jako pułap prawdopodobnie już osiągnięty. Szacunek ten odnosi się do września 2026 roku.
Zestawienie FRI nie oznacza jednak, że przewidywania specjalistów były zaniżone we wszystkich kategoriach. W zadaniach wymagających wiedzy biologicznej i procedur laboratoryjnych modele okazały się mniej skuteczne, niż zakładano. Eksperci z dziedziny nauk biologicznych prognozowali, że wsparcie modelu i dostęp do internetu pozwolą uczestnikom kontrolowanego eksperymentu poprawnie wykonać 22,5 proc. zadań. W rzeczywistości wskaźnik ten wyniósł 5,2 proc., a sam model nie zapewnił mierzalnej przewagi nad korzystaniem ze standardowych zasobów sieci.
Autorzy opracowania podkreślają, że wnioski mają charakter wstępny ze względu na asymetrię samej metody weryfikacji. O ile zbyt ostrożne prognozy można łatwo wykazać w momencie wcześniejszego przekroczenia danego kamienia milowego, o tyle przewidywania nadmiernie optymistyczne będzie można ostatecznie zweryfikować dopiero po upływie założonych w nich terminów.
