LLM

JetBrains Mellum2: Koniec z monolitycznymi modelami w IDE. Szybkość to teraz priorytet

JetBrains rzuca wyzwanie gigantom, ale robi to na własnych zasadach. Zamiast ścigać się na miliardy parametrów, które wymagają serwerowni wielkości boiska, firma wypuściła Mellum2. To model typu Mixture-of-Experts (MoE), który ma 12 miliardów parametrów, ale w locie aktywuje tylko 2,5 miliarda na każdy token. Efekt? Dwukrotnie szybsza praca niż u konkurencji i precyzja skrojona pod programistów.

Dlaczego to ważne teraz

Debiut Mellum2 trafia w punkt zwrotny rynku AI. Firmy zaczynają uciekać od absurdalnie drogich „frontier models” na rzecz wyspecjalizowanych, samodzielnie hostowanych rozwiązań, które gwarantują kontrolę nad danymi i niskie opóźnienia. Otwarta licencja Apache 2.0 pozwala na komercyjne wdrożenia bez obaw o ukryte koszty licencyjne czy wyciek kodu do zewnętrznych chmur.

Architektura MoE w służbie efektywności

Mellum2 to nie jest kolejny model do wszystkiego. Został wytrenowany na 10,6 biliona tokenów z naciskiem na teksty techniczne i kod źródłowy. Wykorzystanie 64 ekspertów, z których tylko 8 bierze udział w generowaniu pojedynczego znaku, sprawia, że model działa z lekkością jednostki 2,5B, zachowując wiedzę znacznie większego systemu. Pod maską pracuje optymalizator Muon i precyzja hybrydowa FP8, co pozwala na płynne działanie w środowiskach produkcyjnych.

Zespół JetBrains wprost definiuje jego rolę: „Pozycjonujemy Mellum2 jako model ogniskowy – szybki, wyspecjalizowany komponent wewnątrz większych systemów AI, a nie samodzielny zamiennik dla modeli ogólnego przeznaczenia”. To podejście „focal model” zakłada, że Mellum2 zajmie się routingiem zapytań, orkiestracją agentów i wstępnym mieleniem danych w potokach RAG.

Praca na żywym organizmie

Dla deweloperów kluczowe jest okno kontekstu. Mellum2 oferuje 131 072 tokenów, co pozwala wciągnąć do pamięci spore repozytorium lub długą dokumentację techniczną. W testach syntetycznych narzędzie wykazuje wysoką skuteczność nie tylko w pisaniu funkcji, ale też w rozumowaniu matematycznym i bezpieczeństwie kodu. Rezygnacja z multimodalności (obrazów, dźwięku) pozwoliła skupić się na tym, co w IDE najważniejsze: braku lagów przy podpowiadaniu składni.

Model jest już dostępny na platformie Hugging Face w wariantach bazowych oraz dostosowanych do instrukcji (SFT/RL). Dzięki otwartym wagom każda firma może go douczyć na własnych, wewnętrznych bibliotekach, tworząc asystenta, który naprawdę rozumie lokalny styl kodowania, zamiast serwować generyczne odpowiedzi z internetu.