Agenci AI

Google Cloud AI Research udostępnia RRSI: agent poprawia własne narzędzia bez zmiany wag modelu

Google Cloud AI Research, wspólnie z badaczami z UNC-Chapel Hill, Stanfordu oraz Washington University w St. Louis, udostępnił na licencji Apache 2.0 otwarty framework badawczy RRSI (Regularized Recursive Self-Improvement). System pozwala agentowi AI na automatyczne modyfikowanie własnego otoczenia roboczego — promptów, dostępnych narzędzi, pamięci i przepływu pracy — bez ingerencji w zamrożone wagi modelu bazowego.

Głównym problemem w pętlach samodoskonalenia agentów jest ryzyko overfittingu: optymalizowany system szybko uczy się specyfiki zadań testowych, reaguje na przypadkowe wahania wyników lub rozrasta się o zbędny kod, tracąc zdolność radzenia sobie z nowymi problemami. RRSI wprowadza mechanizmy selekcji, które mają kontrolować ten proces.

Krytyk promptów i kontrola kosztu tokenów

Zanim jakakolwiek modyfikacja zostanie zaakceptowana, przechodzi weryfikację przez automatycznego krytyka. Jego zadaniem jest wyłapywanie nazw konkretnych zadań, encji czy sztywnej logiki dopasowanej pod dany benchmark. Dodatkowo uzyskany wzrost skuteczności musi przekroczyć próg statystycznego szumu pomiarowego, obliczanego na niezmienionym agencie.

System bierze również pod uwagę koszt wnioskowania. Propozycja zmian może zostać odrzucona, nawet jeśli przynosi wyższy wynik, jeśli wymaga nieuzasadnionego wzrostu liczby zużywanych tokenów. Komponenty, które przestają przynosić mierzalne korzyści, są z czasem usuwane z harnessu. Budżet dopuszczalnych edycji stopniowo maleje w kolejnych rundach, co wymusza przechodzenie od szerszych eksperymentów do pojedynczych, precyzyjnych poprawek.

Transfer na zadania odłożone i ograniczenia ewaluacji

Według wyników przedstawionych przez autorów, w teście z modelem Claude Opus 4.8 skuteczność na zbiorze rozwojowym Terminal-Bench 2.1 wzrosła z 74,2 do 80,2 proc. Poprawa przeniosła się także na zadania, których nie używano do selekcji poprawek: na SWE-bench Verified wynik wzrósł z 82,0 do 83,8 proc., na JobBench poprawa wyniosła 4,7 punktu, na GDPval 3,5 punktu, a na APEX-Agents 3,7 punktu. Średni wzrost na sześciu benchmarkach OOD wyniósł 3,4 punktu.

Przewaga metody zależy jednak od benchmarku. W bezpośrednim porównaniu na zbiorze rozwojowym Harvey LAB wyższy wynik uzyskał konkurencyjny Meta-Harness (93,0 wobec 90,5 dla RRSI). RRSI zanotował natomiast wyższą średnią na trzech wskazanych przez badaczy testach spoza rozkładu (43,6 wobec 40,6 dla Meta-Harness).

W opisie projektu pojawiają się też rozbieżności w raportowanych oszczędnościach zasobów — abstrakt pracy mówi o 30 proc., a strona projektu o 36 proc. redukcji zużycia tokenów polityki (z 3,80 mln do 2,42 mln na próbę). Wszystkie opublikowane dane pochodzą wyłącznie z ewaluacji przeprowadzonej przez autorów i nie zostały dotąd zweryfikowane w niezależnych replikacjach.