Agenci AI

Samodoskonalenie agentów bez uczenia się testów na pamięć. Nowa metoda od Google

Agenci AI, którzy wielokrotnie modyfikują własne narzędzia na podstawie wyników testów, z czasem zaczynają uczyć się specyfiki samych sprawdzianów. Zespół Google Cloud AI Research wraz z naukowcami z kilku uczelni przedstawił metodę RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), która ma ograniczać to zjawisko poprzez nałożenie ścisłych reguł na proces optymalizacji.

Współczesny agent sztucznej inteligencji składa się nie tylko z modelu językowego, ale też z tak zwanego harnessu — warstwy instrukcji systemowych, definicji narzędzi, pamięci i procedur sterujących. To ten zestaw reguł decyduje, jak model radzi sobie z błędami, w jakiej kolejności wykonuje operacje czy w jakim formacie zwraca odpowiedzi. W badaniu wagi bazowego modelu (Claude Opus 4.8) pozostawały niezmienione, a samodoskonalenie polegało wyłącznie na automatycznym przepisywaniu i testowaniu elementów harnessu.

Gdy taki proces przebiega bez ograniczeń, system łatwo ulega dopasowaniu do konkretnych testów: rozbudowuje instrukcje pod wąskie przypadki brzegowe lub dodaje procedury, które podnoszą wynik w jednym benchmarku, ale nie sprawdzają się nigdzie indziej. RRSI wprowadza mechanizmy kontrolne na etapie generowania i selekcji zmian.

W początkowych rundach system dopuszcza większe przeróbki, jednak z każdą kolejną iteracją limit niezależnych zmian w jednej propozycji maleje. Późniejsze etapy wymuszają wprowadzanie jedynie drobnych poprawek, których rzeczywisty wpływ na działanie agenta łatwiej zmierzyć. System rejestruje wcześniejsze próby, aby nie powielać nieskutecznych rozwiązań, a gdy postęp ustaje, kieruje uwagę na dotąd niemodyfikowane części harnessu. Dodatkowo moduł krytyka automatycznie odrzuca propozycje zawierające wpisane na sztywno nazwy zadań, gotowe fragmenty odpowiedzi lub inne zabiegi pod konkretne testy. Zmiany zwiększające złożoność obliczeniową są akceptowane wyłącznie wtedy, gdy przynoszą wyraźną poprawę rezultatów.

Skuteczność podejścia przetestowano na ośmiu benchmarkach obejmujących programowanie, zadania biurowe oraz projektowanie inżynieryjne. Wyniki porównano z niemodyfikowanym harnessem bazowym oraz czterema innymi metodami optymalizacji.

Eksperyment pokazał wyraźny kompromis: na zadaniach wykorzystanych do samej optymalizacji RRSI osiągnęło najmniejszy wzrost spośród testowanych metod (maksymalnie o 14,1 punktu), ale najlepiej uogólniło uzyskane wyniki na pięć wcześniej niewidzianych benchmarków, notując na nich wzrost do 4,7 punktu. W przeciwieństwie do dwóch innych metod optymalizacji, wynik RRSI na żadnym z nowych zestawów nie spadł poniżej poziomu bazowego.

Zoptymalizowany w ten sposób harness okazał się także bardziej zwarty: podczas wykonywania zadań zużywał o około 30 proc. mniej tokenów niż wersja rozwijana bez regularyzacji, choć nadal wymagał więcej zasobów niż pierwotny, nierozbudowany wariant bazowy.

Badacze sprawdzili również, jak ulepszenia przenoszą się między różnymi modelami. Zoptymalizowany harness programistyczny, opracowany przy użyciu Gemini 3.5 Flash, uruchomiono bez żadnych dodatkowych modyfikacji z mniejszym modelem Gemini 3.1 Flash Lite. Jego wynik w teście wzrósł z 11,2 do 14,6 punktu.

Autorzy zaznaczają, że badanie koncentrowało się wyłącznie na harnessach budowanych wokół zamrożonych modeli. Pytanie o to, jak podobna regularyzacja zadziała w sytuacji jednoczesnego dotrenowywania wag samego modelu, pozostaje otwarte.