GPT-6 Astra: Kiedy sztuczna inteligencja zaczyna tworzyć własne zasady
GPT-6 Astra wprowadza nową dynamikę w rozwoju agentów AI, odchodząc od prostego sterowania opartego na kodzie w stronę samodzielnej interpretacji otoczenia. W przeciwieństwie do wcześniejszych modeli, jak Voyager Nvidii, który korzystał z bezpośredniego dostępu do danych gry (API), Astra operuje na poziomie zwykłego użytkownika. Analizuje obraz z ekranu i za pomocą klawiatury oraz myszy buduje własną symboliczną bibliotekę reguł, przekładając obserwacje na konkretne plany działania.
Przeskok wydajności w świecie gier
Efektywność tej metody widać w bezpośrednich porównaniach z poprzednikami. W Pokémon FireRed Astra zdobyła tytuł mistrza w zaledwie 18 godzin i 12 minut. Dla porównania, model GPT-5.6 Sol potrzebował na to samo zadanie 96 godzin i 35 minut, a GPT-5.5 nie ukończył gry nawet po 218 godzinach testów. Podobną dominację odnotowano w Factorio: Astra wyprodukowała niebieskie pakiety nauki w dwie godziny, a po dziesięciu godzinach wystrzeliła pierwszą rakietę – etap, na którym wcześniejsze systemy zazwyczaj przestawały robić postępy.
Skok jakościowy potwierdzają również wyniki w benchmarku ARC-AGI-3, mierzącym zdolność AI do adaptacji w nieznanych środowiskach. Astra osiągnęła wynik 62,7% w standardowym teście, co deklasuje Claude Opus 5 (ok. 30%) i GPT-5.6 Sol (7,78%). Skala tej dominacji jest jeszcze wyraźniejsza w zestawieniu z możliwościami człowieka – Astra zdołała przekroczyć ludzką efektywność na 96% poziomów wchodzących w skład testu ARC-AGI-3. W zoptymalizowanym środowisku testowym (harnessie) OpenAI wynik ten wzrasta do niemal 99,9%, co sugeruje, że model potrafi niemal bezbłędnie odkrywać reguły rządzące abstrakcyjnymi problemami. Poza testami adaptacji, OpenAI raportuje również maksymalne wyniki w innych obszarach – Astra osiągnęła 100% punktów w benchmarku ExploitBench, co wskazuje na pełne nasycenie dostępnych wskaźników sprawdzających konkretne umiejętności agentowe.
Pułapka nadmiernej generalizacji
Mechanizm tworzenia reguł, który decyduje o sukcesach Astry, jest jednak obarczony specyficznym ryzykiem: nadmierną generalizacją na podstawie pojedynczych zdarzeń. Najbardziej jaskrawym przykładem stała się sesja w Minecraft. Gdy Creeper wysadził skrzynię z cennymi przedmiotami, Astra zapisała w swojej bazie zasadę: „ZAWSZE NOSIĆ KRYTYCZNE PRZEDMIOTY przy sobie; nigdy więcej nie trzymaj ich w niestrzeżonej skrzyni”.
Efektem tej „lekcji” była zmiana priorytetów modelu, która sparaliżowała dalszą rozgrywkę. Przez kolejne godziny Astra, zamiast realizować cele, zajmowała się niemal wyłącznie uprawą ziemniaków, wykazując przesadną ostrożność wobec każdego zielonego obiektu na ekranie. Zdolność do wyciągania wniosków z porażek, która pomogła modelowi przetrwać trudne sekwencje w Fallout 3 poprzez weryfikację każdego kliknięcia, w tym przypadku doprowadziła do utrwalenia nieoptymalnego zachowania.
Choć Astra wykazuje rekordową sprawność agentową, przypadek „traumy ziemniaczanej” pokazuje, że automatyczne tworzenie symbolicznych reguł wciąż nie gwarantuje umiejętności odróżniania incydentalnego pecha od stałej mechaniki świata.
