LLM

GPT-5.5 wkracza do gry: OpenAI odzyskuje tron i wystawia słony rachunek

Kodowanie na sterydach i polski ślad

To nie była zwykła premiera. 23 kwietnia 2026 roku OpenAI przypomniało konkurencji, dlaczego to oni dyktują reguły w Dolinie Krzemowej. GPT-5.5 nie jest tylko kolejną inkrementalną aktualizacją – to manifest siły skierowany prosto w stronę Anthropic, które ostatnio borykało się z regresją jakości swojego flagowca.

Najgłośniejszym echem odbiło się jednak nie samo API, a konkretny przypadek użycia z Poznania.

Bartosz Naskręcki z Uniwersytetu Adama Mickiewicza rzucił wyzwanie nowej architekturze, budując jednym promptem aplikację do geometrii algebraicznej w 11 minut. To, co wcześniej wymagało tygodni pracy w specjalistycznych bibliotekach typu Sage, model wygenerował jako gotowy produkt „Surface Intersection Lab”. OpenAI tak bardzo zaimponował ten wynik, że Naskręcki stał się jedną z zaledwie dwóch osób imiennie cytowanych na oficjalnym blogu firmy.

Podatek od inteligencji

Za ogromne możliwości przyjdzie nam jednak słono zapłacić. Cena za milion tokenów wejściowych wzrosła dwukrotnie w porównaniu do wersji 5.4, osiągając pułap 5 dolarów w API. Jeszcze bardziej drastycznie wygląda to w przypadku modelu Pro – tutaj za milion tokenów wyjściowych zapłacimy aż 180 dolarów.

OpenAI próbuje łagodzić ten cios argumentem efektywności: GPT-5.5 ma zużywać mniej jednostek do wykonania tych samych zadań, co teoretycznie powinno bilansować rachunki. Jednak test Simona Willisona pokazuje brutalną prawdę – tryb wysokiego rozumowania (reasoning_effort xhigh) potrafi spalić ponad 9000 tokenów na jedno proste zadanie rysunkowe. To luksus, na który pozwolą sobie tylko najbogatsi gracze.

Benchmarki: Granica możliwości nadal utrzymana

Marketingowy przekaz o totalnej dominacji pęka, gdy spojrzymy w głąb tabel testowych. GPT-5.5 to bestia w środowisku terminalowym i matematycznym, ale wciąż ma swoje „pięty achillesowe”.

  • Terminal-Bench 2.0: GPT-5.5 miażdży konkurencję z wynikiem 82,7%.
  • FrontierMath: W najtrudniejszym Tier 4 model OpenAI osiąga 39,6%, deklasując Claude Opus 4.7 (22,9%).
  • SWE-Bench Pro: Tutaj następuje zwrot – to Claude Opus 4.7 wciąż lepiej radzi sobie z realnym naprawianiem kodu na GitHubie (64,3% vs 58,6%).

Autofagia inżynieryjna

Szczególnie fascynujący jest fakt, że GPT-5.5 pomógł zoptymalizować… samego siebie. Nowy Codex przeanalizował ruch na serwerach OpenAI i napisał algorytmy partycjonowania obciążenia między GPU, co przełożyło się na 20-procentowy wzrost szybkości generowania tokenów. To rzadki przypadek, w którym sztuczna inteligencja realnie buduje lepszą klatkę dla własnej inteligencji.

Czy Anthropic ma się czego obawiać?

Moment premiery GPT-5.5 to klasyczne zagranie siły. OpenAI uderzyło dokładnie wtedy, gdy Anthropic musiał gęsto tłumaczyć się z degrengolady modelu Opus 4.7. Deweloperzy wylewający żale na Reddicie już zapowiadają powrót do ekosystemu Sama Altmana, chwaląc model za to, że „trzyma się zadania znacznie dłużej bez przedwczesnego poddawania się”.

Mimo to Anthropic nie składa broni, mając za plecami 25 miliardów dolarów od Amazona. Obecna sytuacja na rynku przypomina mapę archipelagu – nie ma jednego kontynentu dominacji, są tylko wyspy przewagi w konkretnych dziedzinach. Wybierasz GPT-5.5 do agentów, Claude’a do code review, a Gemini do pracy z gigantycznym kontekstem sięgającym 2 milionów tokenów.

Werdykt jest prosty: OpenAI znów ma najmądrzejszy model na świecie, ale po raz pierwszy tak wyraźnie daje do zrozumienia, że inteligencja na poziomie eksperckim staje się dobrem luksusowym.