Badacze Nvidii odchudzają pracę agentów AI bez zmiany modelu. Kluczem jest harness
Agenci programistyczni wykonujący złożone zadania generują duże zapotrzebowanie na tokeny przy każdym wywołaniu narzędzia, analizie kodu czy kolejnej pętli weryfikacji. Badacze z Nvidii postanowili poszukać oszczędności nie w zmianie samego modelu językowego ani obniżaniu kosztu pojedynczego tokenu, lecz w optymalizacji warstwy pośredniczącej, która zarządza procedurami pracy agenta.
Opracowany przez nich system badawczy SoL-Pi skupia się na tak zwanym harnessie — oprogramowaniu sterującym przepływem informacji między modelem a jego środowiskiem. To ta warstwa decyduje, jakie dane trafiają do kontekstu, kiedy wywołać zewnętrzne narzędzie i jak przetworzyć odpowiedź. SoL-Pi analizuje ślady działania agenta, proponuje modyfikacje w logice sterującej i sprawdza ich wpływ na efektywność oraz jakość rozwiązywania zadań.
Oszczędność tokenów a skuteczność
Wyniki eksperymentów na benchmarku EdgeBench pokazują, że głęboka redukcja liczby tokenów nie oznacza automatycznie wyższej skuteczności. Wariant SoL-Pi łączący cztery mechanizmy optymalizacyjne zużył o 49 proc. mniej tokenów niż bazowy harness Pi, uzyskując 93,7 proc. jego wyniku jakościowego. Z kolei inna konfiguracja, oparta na pojedynczym, najmocniejszym mechanizmie, poprawiła wynik bazowego Pi o 5,3 proc., również ograniczając zużycie tokenów.
Aby uniknąć ryzyka, że automatycznie dobrany harness zadziała wyłącznie na zadaniach użytych podczas optymalizacji, autorzy oddzielili etap wyszukiwania zmian od ewaluacji końcowej. Spośród 51 zadań w zestawie EdgeBench 40 zarezerwowano wyłącznie do testu końcowego, a uzyskanych na nich wyników nie przekazywano z powrotem do algorytmu optymalizującego.
Cztery mechanizmy optymalizacji
W toku przeszukiwania setek wariantów SoL-Pi wyłonił cztery główne mechanizmy ograniczające zbędne przetwarzanie danych:
- Action Fusion — łączy dwa następujące po sobie kroki (na przykład edycję kodu i natychmiastowe uruchomienie testu), co pozwala pominąć jedno pełne wywołanie modelu,
- Online Context Compact — skraca zgromadzony kontekst po kolejnych etapach planowania, usuwając zbędne informacje pośrednie,
- ObservationPack — archiwizuje obszerne odpowiedzi narzędzi i w kolejnych krokach zastępuje je zwięzłymi podsumowaniami,
- Evidence-Preserving Reducer — przekazuje długie logi błędów i testów do tańszego modelu, który wyciąga z nich najważniejsze ustalenia przed włączeniem do głównego promptu.
Różne wyniki poza głównym benchmarkiem
Eksperymenty wykazały, że efektywność harnessu zależy od charakteru zadania i użytego modelu. SoL-Pi został opracowany na podstawie śladów działania GPT-5.6 Sol, a następnie sprawdzony bez zmian z modelem Opus 5. W tym drugim przypadku system zachował 94,3 proc. wyniku bazowego Pi przy podobnym ograniczeniu tokenów, choć mechanizmy redukcji uruchamiały się rzadziej.
Poza benchmarkiem EdgeBench rezultaty były zróżnicowane. W teście 63 zadań terminalowych z Terminal-Bench 4 SoL-Pi rozwiązał 15 zadań, podczas gdy bazowy Pi oraz natywny harness Codex rozwiązały po 18 — choć wariant SoL-Pi wygenerował przy tym łączne koszty niższe o około jedną czwartą. Z kolei w zadaniach formalnej weryfikacji w Lean 4 z olimpiady IMO 2026 system rozwiązał trzy z sześciu zadań i uzyskał najniższy koszt w przeliczeniu na rozwiązany problem. W eksperymencie optymalizacji jądra obliczeniowego rój agentów zoptymalizowanych przez SoL-Pi osiągnął najlepszy wynik, kosztując o 26,8 proc. mniej niż rój oparty na bazowym harnessie Pi.
Wyniki badania pokazują, że zmiana sposobu organizacji pracy agenta pozwala ograniczyć zużycie zasobów bez ingerencji w architekturę samego modelu. Wybór konkretnej konfiguracji pozostaje jednak kompromisem między maksymalnym cięciem liczby tokenów a zachowaniem pełnej skuteczności w trudniejszych zadaniach.
