Mercury 2.5: Inception rzuca wyzwanie gigantom szybkością 1107 tokenów na sekundę
Rynek dużych modeli językowych przyzwyczaił nas do wyścigu na parametry, ale Inception postanowiło zmienić reguły gry, stawiając na surową przepustowość i efektywność kosztową. Mercury 2.5, najnowsze dziecko startupu, debiutuje z wynikiem 1107 tokenów na sekundę na powszechnie dostępnych układach NVIDIA. To nie tylko pokaz siły technicznej, ale realna próba przejęcia infrastruktury dla agentów AI pracujących w czasie rzeczywistym.
Dlaczego to ważne właśnie teraz? W świecie zdominowanym przez ciężkie modele, Mercury 2.5 wchodzi do gry z oknem kontekstowym rzędu 260 tysięcy tokenów i agresywną ceną, stając się realną alternatywą dla najszybszych wariantów od Google czy OpenAI. Potrafi przetworzyć ogromne zbiory danych w ułamku sekundy, co przy obecnym zapotrzebowaniu na autonomicznych asystentów głosowych może wywrócić stolik dostawców usług chmurowych.
Skok wydajności w architekturze dyfuzyjnej
Twórcy modelu deklarują 40-procentowy wzrost inteligencji względem poprzednika, przy zachowaniu tego samego profilu energetycznego. Mercury 2.5 plasuje się w tej samej lidze jakościowej co zoptymalizowane pod kątem kosztów warianty rynkowych gigantów – mowa tu o GPT-5.6 Luna, Gemini 3.5 Flash-Lite czy Claude Haiku 4.5. Kluczem do sukcesu okazała się architektura oparta na dyfuzji, która pozwala na generowanie odpowiedzi bez typowego dla klasycznych transformerów narzutu opóźnień.
Model oferuje imponujące okno kontekstowe, które według serwisu Morningstar zostało rozszerzone do 260 tysięcy tokenów z wcześniejszych 128 tysięcy. Obsługa ustrukturyzowanego formatu JSON i równoległe wywoływanie narzędzi (tool calls) czynią go atrakcyjnym dla deweloperów budujących złożone systemy agentowe. Inception celuje w zastosowania, gdzie liczy się każda milisekunda – od wyszukiwarek po zaawansowane systemy wspierające programistów.
Realne zyski w produkcji
Wdrożenia pilotażowe pokazują, że obietnice producenta znajdują pokrycie w faktach. Platforma OpenCall, wykorzystująca Mercury 2.5 do obsługi połączeń głosowych, odnotowała medianę opóźnienia na poziomie zaledwie 170 milisekund. Jeszcze większe wrażenie robią statystyki firmy Augment Code, gdzie przeniesienie procesów na nowy model skróciło czas oczekiwania z 150 sekund do zaledwie 27 sekund, redukując przy tym koszty o 90%.
Strategia cenowa Inception jest agresywna. Standardowe stawki wynoszą 0,20 USD za milion tokenów wejściowych i 0,75 USD za wyjściowe, jednak na start oferowana jest 80-procentowa zniżka. Jak podaje oficjalny blog Inception, to jasny sygnał dla rynku: firma chce stać się fundamentem nowej generacji usług AI, zanim konkurencja zdąży odpowiedzieć optymalizacją własnych wag.
Ekosystem Mercury się rozrasta
Równolegle z premierą modelu głównego, firma udostępniła w wersji zapoznawczej dwa nowe narzędzia: Mercury Voice oraz Mercury Router. Ten drugi ma pełnić rolę inteligentnego dyspozytora, analizującego zapytania i kierującego je do odpowiednich modeli w zależności od wymaganego balansu między jakością a ceną. Choć Mercury 2.5 jest obecnie największym modelem w portfolio, firma już zapowiedziała prace nad jeszcze potężniejszą jednostką, która ma utrzymać rekordową sprawność generatywną.
