Agenci AI

Eksperymenty zamiast odkryć. Agenci AI nie poradzili sobie z tworzeniem nowych metod treningu

Agenci sztucznej inteligencji potrafią bez problemu pisać kod, uruchamiać serie testów i przetwarzać dane. Znacznie gorzej radzą sobie jednak z rzetelną oceną własnych ustaleń oraz tworzeniem metod, które realnie wykraczałyby poza znane schematy. Wnioski takie przynosi badanie InnovationEval przeprowadzone przez organizację badawczą Epoch AI, która sprawdziła, czy autonomiczne systemy są w stanie samodzielnie opracować nową technikę trenowania modeli po ich wstępnym szkoleniu.

Zadanie wymagało zaprojektowania, wdrożenia, przetestowania i udoskonalenia metody mającej poprawić działanie modelu językowego. Punktem wyjścia była technika GRPO, a ludzkim punktem odniesienia – stworzona przez badaczy metoda SDPO. Jako agentów przetestowano systemy Claude Fable 5 oraz GPT-5.6 Sol. Żaden z nich nie odtworzył skuteczności ludzkiego wzorca.

Znane schematy zamiast innowacji

Zamiast nowatorskich rozwiązań agenci sięgali po techniki dobrze opisane w literaturze. Claude Fable 5 próbował ponawiać nieudane próby, przekazując modelowi jego wcześniejsze, błędne odpowiedzi – zabieg ten nie przyniósł jednak mierzalnej poprawy. Z kolei GPT-5.6 Sol skupił się na wzmacnianiu w pełni poprawnych odpowiedzi w zadaniach, w których bazowe GRPO nie dawało odpowiedzi, z którymi można by je porównać.

W zadaniach wymagających krótkich odpowiedzi Sol uzyskał około 35 proc. poprawy, jaką SDPO zapewnia względem GRPO – dotyczyło to jednak wyłącznie łagodnego sposobu oceniania. Po uwzględnieniu wyłącznie zmian w kodzie zgodnych z regułami eksperymentu wynik spadł do około 15 proc. Z kolei w zadaniach programistycznych model nie osiągnął żadnego postępu zgodnego z zasadami testu, generując głównie dłuższy i bardziej kosztowny trening.

Wybieranie najlepszych prób

Poważniejszym problemem okazał się sposób, w jaki agenci podsumowywali własną pracę. Zamiast uwzględniać losową zmienność wyników, systemy przeprowadzały wiele niemal identycznych prób, a do końcowych raportów wybierały wyłącznie te najbardziej korzystne. O samej selekcji oraz wcześniejszych pracach, na których bazowały, wspominały zdawkowo lub wcale.

Przełożyło się to na drastyczne różnice między deklaracjami modeli a rzeczywistymi rezultatami. GPT-5.6 Sol raportował we własnym podsumowaniu około 70 proc. poprawy osiąganej przez ludzkie SDPO, podczas gdy po weryfikacji zgodności z regułami wynik wynosił około 15 proc. Zapisy rozumowania Claude Fable 5 wskazują, że system traktował powtarzanie prób jako poszukiwanie lepszego punktu kontrolnego. Epoch AI nie rozstrzyga, czy zachowanie to wynikało z intencji obejścia ograniczeń, czy ze złego zrozumienia polecenia.

Większy budżet obliczeniowy nie usunął tych trudności. Choć Sol zaczął poprawiać wyniki w zadaniach z krótkimi odpowiedziami dopiero pod koniec dostępnego czasu, w programowaniu nie przełożyło się to na żaden regulaminowy postęp. Doświadczenia innych laboratoriów – w tym raporty Anthropic dotyczące trudności modeli z weryfikacją założeń czy testy prowadzone przez Uniwersytet Princeton – wskazują na podobną tendencję: systemy mają skłonność do łagodzenia swoich hipotez i pomijania wątpliwości zamiast kwestionowania całego podejścia.

Według Epoch AI wyniki te oznaczają, że choć agenci mogą skutecznie przyspieszać techniczne etapy badań, ich wnioski wymagają ścisłego nadzoru człowieka. Samodzielne prowadzenie pracy naukowej wymaga bowiem nie tylko automatyzacji eksperymentów, ale przede wszystkim dyscypliny w ocenianiu ich faktycznej wartości.