Rozumowanie

OpenAI i trik ze środowiskiem testowym: GPT-5.6 Sol rzekomo gromi konkurencję w teście ARC-AGI-3

Zamiast surowej mocy obliczeniowej, OpenAI postawiło na sprytny osprzęt. Firma ogłosiła, że jej najnowszy model GPT-5.6 Sol osiągnął 38,3 procent w teście ARC-AGI-3, zostawiając w tyle model Opus 5 od Anthropic. Sukces ma jednak drugie dno: rekord padł w autorskim środowisku testowym OpenAI, a nie w oficjalnym reżimie benchmarku. Gdy tylko odłączono systemy wspomagające, skuteczność Sol drastycznie spadła do marnych 7,8 procent.

Dlaczego to starcie jest teraz tak istotne? Branża odchodzi od statycznych testów na rzecz ARC-AGI-3, który jako pierwszy interaktywny benchmark wymusza na agentach AI naukę w locie i budowanie elastycznych modeli świata. To odejście od zgadywania na rzecz rzeczywistego planowania długoterminowego i adaptacji do nieznanych wcześniej warunków.

Architektura wspomagająca zamiast czystej logiki

Wysoki wynik OpenAI to efekt zastosowania funkcji „Retained Reasoning” oraz „Compaction”. Pierwsza pozwala modelowi zachować ciąg myślowy między krokami zadania, druga zaś streszcza kontekst, chroniąc go przed ucięciem. Oficjalny test odrzuca zapis rozumowania po każdej akcji, co obnaża braki Sol. Dla porównania, Opus 5 uzyskał 30,2 procent bez dodatkowych ulepszeń, w restrykcyjnym środowisku.

Walka o procenty i ludzką sprawność

Według twórców ARC Prize, poprzeczka zawieszona jest ekstremalnie wysoko. Jak czytamy w dokumentacji: „Wynik 100% oznacza, że agenci AI mogą pokonać każdą grę tak wydajnie, jak ludzie”. Obecne rezultaty na poziomie 30-38 procent pokazują, jak daleka droga dzieli maszyny od ludzkiej zdolności do generalizacji z zaledwie trzech przykładów, co jest standardem w zadaniach typu ARC-AGI-1.

Koniec z testowaniem modeli w próżni?

OpenAI broni swojej metodologii, twierdząc, że należy oceniać całe systemy, a nie same algorytmy. To ryzykowna teza w kontekście benchmarku stworzonego do mierzenia „czystej” inteligencji. Analitycy zauważają, że gdyby Opus 5 otrzymał od Anthropic podobne wsparcie systemowe, wynik prawdopodobnie przyćmiłby osiągnięcie Sol. Wyścig trwa, ale zamiast przełomu w samym rozumowaniu, dostaliśmy pokaz optymalizacji środowiska pod kątem konkretnego wyniku.