MiniMax M3 rzuca wyzwanie gigantom. Milion tokenów kontekstu na układach Nvidii
Zamiast doklejać funkcje wideo do starych modeli tekstowych, MiniMax postawił na surową siłę obliczeniową i natywną architekturę. Model M3, dysponujący 428 miliardami parametrów, wchodzi na infrastrukturę Nvidii jako rzadkie połączenie gigantycznego okna kontekstowego z obsługą multimediów od pierwszego etapu trenowania.
Dlaczego to ważne teraz
Premiera M3 to sygnał, że wyścig na długość kontekstu przestał być domeną wyłącznie najbogatszych laboratoriów z USA. Udostępnienie modelu o takich gabarytach na otwartej infrastrukturze Nvidii oznacza, że firmy mogą wdrażać zaawansowane systemy agentowe i analizę wideo bez kompromisów jakościowych. To pierwszy model tej klasy, który łączy natywną multimodalność z tak sprawne zoptymalizowaną architekturą MoE (Mixture of Experts).
Architektura bez kompromisów
MiniMax M3 nie jest kolejnym klonem GPT. Inżynierowie przeszkolili go na blisko 100 bilionach tokenów przeplatanych danych multimodalnych. Efekt? Model od podstaw „rozumie” relacje między klatką filmu a opisem tekstowym. Jak podaje blog Nvidii, podejście „step 0” pozwala uniknąć błędów interpretacyjnych typowych dla systemów, w których multimodalność dodano dopiero po zakończeniu treningu bazowego.
Milion tokenów w zasięgu ręki
Największe wrażenie robi okno kontekstowe o pojemności miliona tokenów (z gwarantowanym minimum 512 tys. w API). Zarządzanie taką masą danych jest możliwe dzięki technologii Sparse Attention (MSA). Według danych Nvidii, rozwiązanie to generuje zaledwie 1/20 kosztów obliczeniowych na token w porównaniu do poprzedniego modelu M2 przy pracy z milionem tokenów. W praktyce deweloperzy odczują to jako 15-krotnie szybsze dekodowanie odpowiedzi, co jest kluczowe przy analizie całych repozytoriów kodu czy godzinnych nagrań monitoringu.
Gotowość do ciężkiej pracy
M3 został skrojony pod procesory graficzne Blackwell i obsługuje formaty BF16 oraz MXFP8, co pozwala wycisnąć maksimum z nowoczesnych serwerowni. Model radzi sobie szczególnie dobrze w zadaniach inżynieryjnych – w teście SWE-bench Pro osiągnął wynik 59,0%, co pozycjonuje go w ścisłej czołówce narzędzi do agentowego kodowania. Dzięki pełnej integracji z TensorRT-LLM i vLLM, firmy mogą uruchamiać M3 lokalnie lub w chmurze, zachowując całkowitą kontrolę nad danymi i kosztami energii.
Dostępność i testy
Model jest już dostępny w katalogu API Nvidii, gdzie inżynierowie mogą testować jego możliwości w ramach darmowych punktów końcowych. Jeśli zapowiedzi o wydajności się potwierdzą, MiniMax M3 może stać się fundamentem dla nowej fali autonomicznych asystentów, które nie gubią wątku nawet po przeanalizowaniu dokumentacji liczącej tysiące stron.
