Nauka

BootLoops wykonuje obliczenia dla naukowców. Rachunki to jednak za mało

Model językowy potrafi bezbłędnie przeprowadzić skomplikowane rachunki, a mimo to wyciągnąć z nich całkowicie błędny wniosek naukowy. Właśnie dlatego automatyczne testy i same moce obliczeniowe nie zastępują badaczy. To jedno z głównych spostrzeżeń, które towarzyszy projektowi BootLoops — otwartemu narzędziu opisanemu przez Matthew Schwartza, fizyka z Uniwersytetu Harvarda pracującego tymczasowo w zespole Anthropic.

BootLoops, którego kod udostępniono w serwisie GitHub, powstał po to, by pomagać modelowi Claude w wykonywaniu precyzyjnych obliczeń i sprawdzaniu ich poprawności. W swojej relacji Schwartz poinformował, że w ciągu trzech miesięcy zespół 19 współautorów przygotował 36 manuskryptów z 18 dziedzin nauki. Nie są to jednak opublikowane ani zrecenzowane artykuły, lecz wersje robocze, w których to ludzie decydowali o kierunku analiz, interpretowali wyniki i weryfikowali sens otrzymanych danych.

Rachunki z fizyki i korekta modeli w ekologii

Początkowo Schwartz testował narzędzie na gruncie fizyki cząstek, zlecając modelowi rozwiązywanie złożonych całek. W ciągu kilku tygodni Claude obliczył 30 takich wyrażeń: 15 z nich posłużyło do odtworzenia znanych już rezultatów, a kolejne 15 — według relacji badacza — zostało obliczonych po raz pierwszy.

Narzędzie sprawdzono również poza fizyką. W ekologii model posłużył do rozwiązania równania z neutralnej teorii różnorodności biologicznej, które przez lata uchodziło za zbyt trudne do masowych obliczeń. Gdy zastosowano je do danych z panamskiej wyspy Barro Colorado, okazało się, że tempo wymiany gatunkowej drzew jest 4,5 raza szybsze, niż przewidywała dotychczasowa teoria. Sam surowy wynik nie stanowił jeszcze rozwiązania problemu — dopiero współpraca z ekologiem Jamesem O’Dwyerem pozwoliła zinterpretować tę rozbieżność i przełożyć ją na lepszy model predykcyjny.

Przedwczesny sukces i pozorna poprawność

Doświadczenia zespołu pokazują, że największym ryzykiem przy wykorzystaniu modeli językowych w nauce nie są wyłącznie proste pomyłki rachunkowe, lecz błędna interpretacja faktów. Schwartz zwraca uwagę, że Claude ma tendencję do przedwczesnego ogłaszania sukcesu, a formuła „gotowe, z jednym zastrzeżeniem” nierzadko oznacza, że zadanie wciąż nie zostało wykonane.

Co istotniejsze, model potrafi wyciągnąć nieprawidłowe wnioski nawet wtedy, gdy cały ciąg matematyczny jest w pełni poprawny. Zamiast szukać eleganckiego rozwiązania, AI potrafi także bezrefleksyjnie zużywać potężne zasoby mocy obliczeniowej i tokenów na rozwiązywanie problemu metodą siłową.

Z relacji Schwartza wynika, że choć narzędzia pokroju BootLoops mogą diametralnie skrócić czas wykonywania żmudnych obliczeń, to formułowanie pytań badawczych, kontrola spójności logicznej i ostateczna ocena znaczenia odkryć pozostają zadaniem naukowców.