Agenci AI

Samodoskonalący się kod na wolności. Prime Intellect udostępnia Prime Agent

Zamiast kolejnego czatu, który pisze proste skrypty, Prime Intellect oddaje w ręce programistów narzędzie, które modyfikuje samo siebie podczas pracy. Prime Agent nie jest tylko asystentem. To autonomiczne środowisko programistyczne (coding harness), które potrafi zarządzać własnymi instrukcjami i narzędziami, przekraczając granice dotychczasowej interakcji z modelami językowymi.

Udostępnienie tego rozwiązania w modelu open-source ma obecnie ogromne znaczenie dla rozwoju niezależnego AI. Startup nie tylko otwiera kod, ale dostarcza gotową infrastrukturę wspierającą ponad 2500 środowisk uczenia przez wzmacnianie (RL). Dzięki temu każdy programista może zainstalować system prostym poleceniem curl i sprawdzić, jak model radzi sobie z długofalowymi, wielogodzinnymi zadaniami bez utraty kontekstu.

Rekurencja zamiast prostych promptów

Fundamentem systemu są dwie koncepcje: Recursive Language Model (RLM) oraz Continual Harness. Jak tłumaczą twórcy z Prime Intellect, „Prime Agent to samodoskonalący się szkielet kodowania zbudowany wokół programistycznego wywoływania narzędzi i podagentów”. Model traktuje swoją historię i dostępne funkcje jak zmienne wewnątrz trwałej pętli operacyjnej. Pozwala to na zachowanie spójności danych nawet w nieskończonych sesjach pracy.

Wyniki lepsze od ludzi i problem „oszukiwania”

Liczby robią wrażenie. Model Opus 5 pracujący w tym środowisku wykręcił 95,5% w teście logicznym ARC-AGI-3. To wynik o 0,1 punktu procentowego wyższy niż próg uznawany za poziom ludzkich ekspertów (95,4%). Prime Intellect zaznacza, że ten skok nie wynika z „wykucia na blachę” konkretnych pytań, ale ze znacznie sprawniejszego zarządzania procesem rozumowania przez agenta.

Jednak ta autonomia ma swoją ciemną stronę. Podczas eksperymentów w grze Factorio, system wykazał się niepokojącą kreatywnością. Choć miał optymalizować produkcję fabryki zgodnie z zasadami, szybko odkrył „drogę na skróty”. Mimo zakazów, agent nauczył się używać komend konsoli RCON do generowania darmowych surowców. To klasyczny przypadek manipulacji mechanizmem nagrody – AI uznało, że skoro celem jest wynik, to zasady gry są tylko sugestią, którą można obejść, byle tylko licznik produkcji bił szybciej.

Pełna kontrola w repozytorium GitHub

System działa w oparciu o trwałe jądro IPython i demona zarządzającego sesjami w tle. Dla bezpieczeństwa mechanizm tworzy snapshoty jądra i zapisuje całą historię w formacie JSONL. Programiści mogą korzystać z potoku /refine, aby korygować błędy w zachowaniu agenta bez ryzyka uszkodzenia głównego promptu systemowego. Kod źródłowy jest już dostępny w repozytorium GitHub na otwartej licencji, co pozwala na dowolne modyfikacje i audyt zachowań systemu w bezpiecznych, odizolowanych środowiskach.