LLM

Koniec dyktatury sekwencyjności: Mercury 2 rzuca wyzwanie Google w wyścigu dyfuzyjnych modeli językowych

W architekturze dużych modeli językowych (LLM) przez lata dominował paradygmat „maszyny do pisania”. Standardowe boty, takie jak GPT czy Claude, generują tekst znak po znaku, sprawdzając każde napisane słowo przed postawieniem kolejnego. To proces z natury liniowy, a co za tym idzie – obarczony opóźnieniami. Inception Labs postanowiło jednak przełamać ten schemat, wprowadzając Mercury 2 – model, który zamiast pisać, zdaje się „wyłaniać” gotową odpowiedź z informacyjnego szumu.

Dlaczego to ważne teraz

Premiera Mercury 2 stanowi moment zwrotny, ponieważ jest to pierwszy na świecie komercyjny model językowy dyfuzyjny (dLLM) wyposażony w realne zdolności do rozumowania. Podczas gdy tradycyjne modele męczą się z latencją, Inception Labs dostarcza narzędzie generujące ponad 1000 tokenów na sekundę. To 14-krotne skrócenie czasu oczekiwania względem konkurencyjnego modelu Claude 4.5 Haiku drastycznie zmienia ekonomię pracy z AI, przesuwając nas w stronę systemów operujących w czasie rzeczywistym bez żadnych odczuwalnych pauz.

Prędkość, która zmienia zasady gry

Mercury 2 debiutuje z impetem, osiągając oszałamiającą prędkość generowania na poziomie 1009 tokenów na sekundę przy użyciu układów NVIDIA Blackwell. Aby uzmysłowić sobie skalę tego osiągnięcia, warto zestawić go z rynkową czołówką: Claude 4.5 Haiku osiąga około 89 tokenów, a GPT-5 Mini zaledwie 71. Choć Google niedawno zaprezentowało model DiffusionGemma o zbliżonych parametrach szybkościowych, Mercury 2 deklasuje giganta z Mountain View pod względem jakości merytorycznej.

Kluczem do sukcesu jest wykorzystanie dyfuzji – technologii, która do tej pory kojarzyła się głównie z generatorami obrazów pokroju Stable Diffusion. Model nie tworzy tekstu sekwencyjnie. Zamiast tego wypełnia blok tekstu losowymi znacznikami i w kilku równoległych przebiegach usuwa „szum”, aż krystalizuje się gotowa, logiczna odpowiedź. Serwis Zenn.dev podkreśla, że „Mercury 2 to pierwszy na świecie komercyjny model językowy dyfuzyjny (dLLM) z capacité do rozumowania, który generuje tekst całościowo, a nie token po tokenie”.

Wydajność potwierdzona w testach

Krytycznym punktem w ocenie modeli generatywnych są benchmarki matematyczne i naukowe. W teście AIME 2026, opartym na trudnych zadaniach z konkursów matematycznych, Mercury 2 uzyskał wynik 90%. Dla porównania, DiffusionGemma osiągnęła jedynie 69,1%, co pokazuje, że Google wciąż boryka się z zachowaniem precyzji przy tak dużej prędkości. Nawet na poziomie GPQA – testu wiedzy naukowej na poziomie doktoranckim – Mercury 2 utrzymuje przewagę, zdobywając 77% punktów.

Co ciekawe, korzyści płynące z tej architektury wykraczają poza suchą statystykę. Studium przypadku przeprowadzone przez Augment Code wykazało konkretne zyski biznesowe. Zastąpienie modelu Claude Opus 4.7 przez Mercury 2 w zadaniach związanych z przetwarzaniem kontekstu pozwoliło na 82-procentową redukcję opóźnień i aż 90-procentową obniżkę kosztów operacyjnych. Przy cenie rzędu 0,75 USD za milion tokenów wyjściowych, model staje się bezkonkurencyjny pod kątem opłacalności.

Krajobraz po rewolucji: Era sub-agentów

Inception Labs, wspierane kapitałem od Nvidii oraz autorytetów takich jak Andrew Ng i Andrej Karpathy, celuje w specyficzny segment rynku. Mercury 2 nie musi być najmądrzejszym modelem na świecie w sensie ogólnym; ma być idealnym „podwykonawcą”. Dzięki oknu kontekstowemu o rozmiarze 128 000 tokenów i pełnej kompatybilności z API OpenAI, wdrożenie go do istniejących systemów jest bezproblemowe.

Nowoczesne systemy AI stają się orkiestrami wyspecjalizowanych pomocników – jeden model zajmuje się głębokim rozumowaniem, inny streszczaniem, a jeszcze inny weryfikacją wyjścia. Modele dyfuzyjne, dzięki swojej przepustowości, pozwalają na swobodne korzystanie z wielu sub-agentów jednocześnie. Chociaż Mercury 2 pozostaje modelem zamkniętym, kierunek zmian jest jasny. Przyszłość należy do systemów, które zamiast kazać użytkownikowi czekać na każdą myśl, potrafią dotrzymać kroku dynamice ludzkiej pracy.