JetBrains udostępnił Mellum2.1. Model zyskał w testach agentowych dzięki nowemu treningowi
JetBrains opublikował Mellum2.1 – model językowy typu Mixture of Experts o łącznej liczbie 12 mld parametrów, z których przy każdym tokenie aktywowane jest 2,5 mld. Wagi udostępniono na otwartej licencji Apache 2.0 z myślą o uruchamianiu lokalnym oraz zastosowaniu w agentach programistycznych.
Pod względem architektury Mellum2.1 nie różni się od wcześniejszej wersji Mellum2. Za poprawę możliwości modelu odpowiada przebudowany etap uczenia końcowego, w którym kluczową rolę odegrało uczenie ze wzmocnieniem (RL) prowadzone w środowiskach inżynierii oprogramowania.
Trening w odizolowanych repozytoriach
Zamiast opierać się wyłącznie na statycznych przykładach kodu, JetBrains zorganizował trening w milionach odizolowanych środowisk utworzonych na bazie tysięcy repozytoriów. Model otrzymywał dostęp do powłoki systemowej i narzędzi do edycji plików, a nagrodę przyznawano mu za pomyślne przejście testów jednostkowych i integracyjnych.
Takie podejście przełożyło się na wyraźny wzrost wyników w testach symulujących pracę agentów programistycznych. Według danych opublikowanych przez JetBrains:
- w benchmarku SWE-bench Verified wynik wzrósł z 2,0 dla Mellum2 do 47,0;
- w SWE-bench Pro rezultat wzrósł z 0,0 do 28,0;
- w Terminal-Bench 2.1 model uzyskał 17,4 wobec wcześniejszych 0,6 punktu.
Deklaracje wydajności i porównanie z Qwenem
Mimo dużego postępu względem poprzednika Mellum2.1 nie prowadzi we wszystkich zadaniach agentowych. W pomiarach przeprowadzonych przez JetBrains konkurencyjny model Qwen3.5-9B osiągnął wyższe rezultaty w SWE-bench Verified (50,0) oraz SWE-bench Pro (38,0), a w testach LiveCodeBench v6 czy HumanEval+ uzyskał niższe wyniki niż Mellum2.1.
Przedstawione wyniki pochodzą z wewnętrznych testów JetBrains, w których wszystkie modele badano według jednolitej procedury w trybie generowania toku rozumowania (thinking). Rezultaty te nie zostały jeszcze niezależnie zreplikowane, a wartości podawane w oficjalnych kartach poszczególnych modeli mogą się różnić w zależności od przyjętej metodologii.
Model obsługuje kontekst o długości do 131 tysięcy tokenów. Wagi przygotowano z myślą o uruchamianiu m.in. w środowiskach vLLM, SGLang oraz w formatach GGUF dla narzędzi takich jak Ollama czy LM Studio. Z deklaracji JetBrains wynika, że dzięki mniejszej liczbie aktywnych parametrów Mellum2.1 osiągał na karcie NVIDIA H200 wyższą przepustowość tokenów – przy dużym obciążeniu może być ona bliska dwukrotności wyniku Qwen3.5-9B. Zastosowanie MTP ma z kolei zwiększać szybkość pojedynczego zapytania około 1,6 raza, choć realna wydajność będzie zależeć od konkretnego środowiska wdrożeniowego.
