LLM

Xiaomi przełamuje barierę prędkości w AI: MiMo-V2.5-Pro deklasuje zachodnią konkurencję

Zamiast czekać na wolne moce przerobowe w centrach danych OpenAI, programiści mogą wkrótce patrzeć, jak tekst wylewa się z ekranu z prędkością karabinu maszynowego. Xiaomi, kojarzone dotychczas głównie z telefonami, właśnie rzuciło wyzwanie gigantom Doliny Krzemowej na polu czystej wydajności obliczeniowej. Chiński producent zaprezentował MiMo-V2.5-Pro-UltraSpeed – nowy tryb pracy swojego flagowego modelu językowego o oszałamiającej liczbie 1,02 biliona parametrów.

Watykańska rewolucja na zwykłym krzemie

Ten ruch jest kluczowy właśnie teraz, ponieważ przenosi najpotężniejszą klasę modeli „frontier AI” ze specjalistycznych, niedostępnych układów na standardową infrastrukturę. Podczas gdy Groq czy Cerebras budują egzotyczne procesory, Xiaomi i TileRT dokonały niemożliwego na zwykłych maszynach. „Dzięki ekstremalnemu Codesignowi osiągnęliśmy ponad 1000 tokenów na sekundę z modelu 1T, używając zaledwie jednego standardowego węzła z ośmioma GPU” – chwali się zespół Xiaomi MiMo.

To, co wyróżnia rozwiązanie Xiaomi, to brak konieczności stosowania wyspecjalizowanych procesorów. Rekordową prędkość, sięgającą w demonstracjach nawet 1200 tokenów na sekundę, uzyskano na powszechnie dostępnych układach. Dla porównania, GPT-5.4 czy Gemini 3.1 Pro działają wielokrotnie wolniej. Wynik Xiaomi jest więc niemal pięciokrotnie wyższy od najszybszych powszechnie dostępnych modeli amerykańskich, choć niezależne testy od Artificial Analysis wskazują, że w standardowym API prędkość spada do około 42,8 tokena na sekundę. Prawdziwy pazur model pokazuje dopiero w dedykowanym trybie UltraSpeed.

Inżynieria zamiast drogiego krzemu

Sekret tak drastycznego skoku wydajności tkwi w architekturze Mixture-of-Experts (MoE). Model posiada 1,02 bln parametrów, ale w danym momencie aktywnych jest tylko 42 miliardy. Inżynierowie zastosowali precyzyjną kwantyzację FP4, ale zrobili to umiejętnie – kompresji poddano jedynie warstwy eksperckie. Dzięki temu MiMo-V2.5-Pro zachowuje imponującą sprawność przy długim kontekście, który sięga aż 1 miliona tokenów.

Drugim filarem sukcesu jest silnik TileRT i mechanizm dekodowania spekulatywnego DFlash. W tradycyjnym podejściu model generuje tokeny jeden po drugim. DFlash pozwala na proponowanie całych bloków tekstu jednocześnie. W testach programistycznych system poprawnie akceptował średnio ponad sześć z ośmiu zaproponowanych tokenów w jednym kroku, co drastycznie skraca czas oczekiwania na wynik.

Nowa era agentów AI

Dlaczego prędkość rzędu 1000 tokenów na sekundę jest tak istotna? To fundament dla autonomicznych agentów. Systemy te muszą w ułamku sekundy analizować dziesiątki ścieżek rozumowania, aby podjąć decyzję. Przy obecnych opóźnieniach modeli zachodnich, praca agentów w czasie rzeczywistym była często zbyt ociężała. Xiaomi celuje w zadania typu software engineering i wieloetapowe procesy decyzyjne, gdzie model musi „myśleć” szybko.

Limitowane testy API ruszają 9 czerwca 2026 roku. Choć tryb UltraSpeed będzie kosztowniejszy, wyjściowa cena za standardowe użycie jest agresywna: 0,87 USD za 1 mln tokenów wyjściowych. Dla badaczy najważniejszą informacją jest jednak to, że firma zdecydowała się na udostępnienie checkpointów FP4 na platformie Hugging Face, umożliwiając każdemu sprawdzenie, czy chiński przełom to rzeczywistość, czy jedynie sprytny marketing.