Koniec ery maszynopisu: Mercury 2 wprowadza dyfuzję do świata modeli językowych
W architekturze dużych modeli językowych (LLM) przez lata dominował paradygmat „maszyny do pisania”. Standardowe boty, takie jak GPT czy Claude, generują tekst znak po znaku, sprawdzając każde napisane słowo przed postawieniem kolejnego. To proces z natury liniowy, a co za tym idzie – obarczony opóźnieniami. Inception Labs postanowiło jednak przełamać ten schemat, wprowadzając Mercury 2 – model, który zamiast pisać, zdaje się – jak mówi Andrew Ng – – – wyłaniać gotową odpowiedź z informacyjnego szumu.
Dlaczego to ważne teraz
Premiera Mercury 2 zdejmuje limit prędkości charakterystyczny dla architektur typu Transformer. Jest to pierwszy komercyjny model dLLM (Diffusion Large Language Model), który generuje odpowiedzi w czasie rzeczywistym, co ma kluczowe znaczenie dla autonomicznych agentów AI działających w złożonych systemach wieloagentowych. Według danych OpenRouter, system ten generuje ponad 1000 tokenów na sekundę, co drastycznie zmienia ekonomikę pracy z AI i eliminuje frustrujące pauzy podczas interakcji.
Prędkość, która narzuca nowe tempo
Mercury 2 debiutuje z impetem, osiągając przepustowość 1009 tokenów na sekundę na układach NVIDIA Blackwell. To 14-krotne przyspieszenie względem Claude 4.5 Haiku, który osiąga około 89 tokenów. Nawet GPT-5 Mini z wynikami rzędu 71 tokenów zostaje daleko w tyle. Choć Google próbowało sił z modelem DiffusionGemma, propozycja Inception Labs deklasuje giganta pod względem jakości merytorycznej.
Kluczem do sukcesu jest wykorzystanie dyfuzji – technologii znanej z generatorów obrazu. Model nie tworzy tekstu sekwencyjnie. Zamiast tego wypełnia blok danych losowymi znacznikami i w kilku równoległych przebiegach usuwa szum, aż wykrystalizuje się logiczna odpowiedź. Andrej Karpathy zauważył, że „to pierwszy model dyfuzyjny, który potrafi rozumować, generując całą sekwencję równolegle i mogący poprawiać błędy w trakcie procesu”.
Wydajność potwierdzona w testach
Krytycznym punktem w ocenie modeli generatywnych są benchmarki matematyczne. W teście AIME 2026 Mercury 2 uzyskał wynik 90% poprawności, zostawiając DiffusionGemma z jej wynikiem 69,1% daleko w tyle. Nawet w teście wiedzy na poziomie doktoranckim GPQA, nowy model utrzymuje wysoką formę z wynikiem 77%. To dowód na to, że ekstremalna prędkość nie musi oznaczać płytkiego rozumowania.
Praktyczne wdrożenia już teraz przynoszą konkretne oszczędności. Augment Code po zastąpieniu modelu Claude Opus 4.7 nowym Mercury 2 odnotował 82-procentową redukcję opóźnień. Przy cenie 0,75 USD za milion tokenów wyjściowych, koszty operacyjne spadły o 90%, co czyni ten system jednym z najbardziej opłacalnych narzędzi na rynku.
Era sub-agentów
Inception Labs, wspierane przez kapitał Nvidii, celuje w rolę idealnego „podwykonawcy”. Dzięki oknu kontekstowemu 128 000 tokenów i pełnej zgodności z API OpenAI, Mercury 2 można szybko wpiąć w istniejące systemy. Nowoczesne AI staje się orkiestrą wyspecjalizowanych pomocników – jeden model zajmuje się głębokim rozumowaniem, inny weryfikacją, a Mercury 2 błyskawicznym przetwarzaniem danych.
- Brak opóźnień przy 1009 tokenach na sekundę.
- Aż 90% niższego kosztu operacyjnego względem konkurencyjnych systemów.
- Zdolność do poprawiania błędów w locie dzięki architekturze dyfuzyjnej.
Przyszłość należy do systemów, które zamiast kazać użytkownikowi czekać na każde słowo, potrafią dotrzymać kroku dynamice ludzkiej pracy bez kompromisów w sferze intelektualnej.
