Koniec monopolu gigantów na szkolenie agentów? Prime Intellect otwiera drogę do modeli 1T
Trenowanie modeli AI o skali biliona parametrów przestało być domeną wyłącznie korporacyjnych laboratoriów z nieograniczonym budżetem. Prime Intellect udostępnił właśnie framework prime-rl 0.6.0, który pozwala na trenowanie potężnych modeli typu Mixture-of-Experts (MoE) przy użyciu optymalizacji, o jakich wcześniej można było tylko pomarzyć w świecie open source.
Dlaczego to ważne teraz
Do tej pory tworzenie zaawansowanych agentów AI zdolnych do samodzielnego programowania czy rozwiązywania problemów inżynieryjnych rozbijało się o mur infrastrukturalny. Prime-rl w wersji 0.6.0 jako pierwszy otwarty framework rozwiązuje problem skalowania uczenia przez wzmacnianie (RL) na tysiącach GPU jednocześnie. Pozwala to mniejszym graczom na elastyczne trenowanie modeli bez posiadania własnych serwerowni wielkości boiska piłkarskiego, co bezpośrednio napędza rozwój otwartych systemów agentowych.
Architektura dla modeli bilionowych
Najnowsza odsłona frameworka wprowadza mechanizmy RL zaprojektowane z myślą o strukturach 1T+. W testach przeprowadzonych na klastrze 512 jednostek H200, model GLM-4.5-Air-Base utrzymał czas kroku treningowego poniżej pięciu minut (ok. 280 sekund), nawet przy sekwencjach sięgających 131 tysięcy tokenów. To dowód na to, że skala nie musi oznaczać paraliżującej powolności.
Paweł Bułowski z Prime Intellect stawia sprawę jasno na swoim profilu LinkedIn: „Agent training is now an infrastructure problem. Jeśli chcesz dotrenowywać duże modele open-source do realnej pracy agentowej, narzędzia nie są już blokadą”.
Asynchroniczność jako klucz do wydajności
Tradycyjne podejście do RL często marnuje potencjał sprzętu – GPU czekają bezczynnie, aż system zakończy interakcję z otoczeniem. Prime Intellect wyeliminował te przestoje poprzez pełną dezagregację trenera od inferencji. Dzięki asynchronicznej naturze, wagi modelu są aktualizowane natychmiast po zakończeniu kroku optymalizatora. Aby uniknąć niestabilności, wprowadzono mechanizm Router Replay (R3). Rejestruje decyzje dotyczące routingu i odtwarza je podczas treningu, co niemal dziesięciokrotnie redukuje dryf polityki (KL mismatch).
Optymalizacja inferencji i pamięci
Wąskim gardłem w systemach agentowych jest generowanie odpowiedzi. Framework wprowadza paralelizm ekspertów (Wide EP) rozproszony na minimum 32 jednostki GPU oraz separację faz prefill i decode. Zastosowanie formatu FP8 z jądrami DeepEP i DeepGEMM przyspiesza obliczenia i gwarantuje stabilność precyzji. Z kolei integracja z systemem Mooncake Store pozwala na inteligentne odciążanie pamięci podręcznej KV do RAM-u i na dyski, co drastycznie zwiększa liczbę zapytań obsługiwanych w tym samym czasie.
Skalowanie bez kompromisów
Trening struktur takich jak NVIDIA Nemotron-3 wymagał połączenia trzech rodzajów paralelizmu: FSDP, EP oraz CP. Kluczowy okazał się autorski paralelizm kontekstu, niezbędny przy sekwencjach przekraczających 100 tysięcy tokenów, gdzie pamięć aktywacji staje się cenniejsza niż same wagi parametrów. Prime Intellect udowadnia, że przy odpowiednim zarządzaniu danymi, bariera wejścia do świata AI klasy 1T właśnie runęła.
