Bez kategorii

Ember-1 od Fireworks AI: krótsze rozumowanie Kimi K3 przy tej samej cenie za token

Fireworks AI udostępniło model Ember-1, opracowany na bazie modelu Kimi K3 z otwartymi wagami od Moonshot AI. Zamiast ograniczać parametr określający poziom wysiłku wkładanego w rozumowanie podczas generowania odpowiedzi, firma przeprowadziła dodatkowy trening (post-training), którego celem było skrócenie wewnętrznych wywodów modelu przy zachowaniu zdolności do samokorekty. Ember-1 jest dostępny jako Research Preview wyłącznie przez API Fireworks – firma nie opublikowała wag ani kodu treningowego.

Głównym punktem odniesienia są wyniki testu A/B przeprowadzonego w środowisku produkcyjnym na zadaniach programistycznych u jednego z dwóch klientów testujących model (jeden z nich wdrożył już model na stałe). Z opublikowanych przez Fireworks danych wynika, że:

  • liczba tokenów wyjściowych na zadanie spadła z 49,3 tys. do 29,9 tys.,
  • liczba tokenów samego rozumowania zmniejszyła się o 71,3 proc.,
  • łączne zużycie tokenów spadło o 39 proc.,
  • ogólny wynik skuteczności pozostał na zbliżonym poziomie: 0,753 dla Ember-1 wobec 0,751 dla Kimi K3.

Deklarowane przez Fireworks oszczędności wynikają wyłącznie z mniejszej objętości generowanego tekstu, a nie ze zmiany stawek. Cennik API dla Ember-1 jest identyczny jak dla Kimi K3: wynosi 3 dolary za milion tokenów wejściowych, 0,30 dolara za milion tokenów wejściowych z pamięci podręcznej oraz 15 dolarów za milion tokenów wyjściowych.

Mieszane wyniki w benchmarkach

W opublikowanych przez dostawcę testach porównawczych Ember-1 nie przewyższa Kimi K3 we wszystkich zastosowaniach. Model w wersji zoptymalizowanej uzyskał wyższe wyniki niż Kimi K3 Max w Terminal Bench 2.1 (82,0% wobec 80,9%) oraz DeepSWE 1.1 (75,2% wobec 66,4%). Wypadł jednak nieco słabiej w testach SWE-bench Verified (92,2% wobec 93,2%) oraz SWE-Interact (20,0% wobec 21,3%).

Przedstawione rezultaty pochodzą wyłącznie z wewnętrznych ewaluacji i testów Fireworks AI. Ponieważ firma nie udostępniła wag modelu do samodzielnego uruchomienia ani szczegółowych danych o próbie zadań produkcyjnych, niezależna weryfikacja tych wyników pozostaje obecnie niemożliwa.