Agenci AI

Cognition wprowadza SWE-2: model zoptymalizowany pod kątem kosztów, dostępny wyłącznie w Devinie

10 września 2026 roku firma Cognition zaprezentowała SWE-2, swój najnowszy model kodujący, który stawia na efektywność kosztową przy zachowaniu wysokiej wydajności. Według deklaracji firmy, nowy model osiąga wyniki zbliżone do rynkowej czołówki, drastycznie redukując przy tym wydatki na inferencję. SWE-2 nie jest jednak dostępny jako samodzielne API ani nie posiada otwartych wag – zintegrowano go wyłącznie z agentem programistycznym Devin (w wersjach Desktop i CLI).

Wydajność pod kontrolą RL

Fundamentem SWE-2 jest model Kimi K3 (2,8T parametrów), opracowany przez firmę Moonshot AI, który poddano procesowi post-treningu z wykorzystaniem uczenia przez wzmacnianie (RL). Zastosowanie technik RL przyniosło wymierne efekty – post-trening pozwolił na poprawę wyników o około 5–6 punktów procentowych w większości benchmarków w porównaniu do bazowej wydajności modelu Kimi K3. Cognition podaje, że dzięki tym optymalizacjom model uzyskał 50,0% w benchmarku FrontierCode 1.1 Main. Firma twierdzi, że wynik ten plasuje SWE-2 w odległości zaledwie jednego punktu procentowego od Fable 5.1, przy kosztach inferencji niższych o 64%. Należy jednak pamiętać, że są to dane pochodzące bezpośrednio od producenta i nie zostały jeszcze zweryfikowane przez niezależne testy.

Najciekawszym aspektem technicznym SWE-2 jest wprowadzenie wybieralnych poziomów wysiłku: medium, high oraz max. Zostały one wytrenowane jednocześnie w jednym przebiegu RL dzięki zastosowaniu kar kosztowych dopasowanych do lokalnego nachylenia krzywej Pareto (ang. slope-matched lambda). W praktyce pozwala to na lepszą kontrolę nad zasobami – w trybie medium model potrzebuje o 58% mniej kroków i generuje o 81% niższe koszty niż starszy SWE-1.7.

Nierówne wyniki w benchmarkach

Mimo sukcesów w wybranych testach, SWE-2 wykazuje wyraźne słabości. Choć model prowadzi w Terminal-Bench 2.1 z wynikiem 92,8%, to w bardziej wymagającym Terminal-Bench 4 osiągnął zaledwie 27,3%. Jest to wynik o około 30 punktów niższy od rynkowych liderów, co pokazuje, że optymalizacja kosztowa może odbijać się na skuteczności w najbardziej skomplikowanych scenariuszach.

Pozostałe parametry techniczne wymieniane przez Cognition obejmują:

  • Skuteczność 73,0% w benchmarku DeepSWE.
  • Zastosowanie kwantyzacji NVFP4 i FP8 dla przyspieszenia działania.
  • Wykorzystanie systemu DSpark do spekulatywnego dekodowania.
  • Poprawę mechanizmów autokorekty błędów w procesie generowania kodu.

Dostępność i ograniczenia

Dla programistów szukających nowego modelu do własnych projektów, SWE-2 pozostaje nieosiągalny poza ekosystemem Cognition. Brak API i wag modelu oznacza, że jedyną drogą do jego przetestowania jest subskrypcja platformy Devin. Choć obecnie dostęp do modelu ograniczony jest do wersji Desktop i CLI, Cognition zapowiedziało już proces wdrażania SWE-2 także w wersjach Devin Web oraz Fusion. Obecnie, zgodnie z polityką cenową, model jest dostępny bez dodatkowych opłat dla użytkowników planów Pro, Max oraz Teams do 10 października 2026 roku.