LLM

Nous Research potęguje wydajność LLM: Token Superposition skraca uczenie wstępne o 60 procent

Koniec z marnowaniem mocy B200

Nauczone doświadczeniem laboratoria AI wiedzą, że koszt trenowania modeli rośnie szybciej niż ich możliwości. Nous Research właśnie uderzyło w ten sufit, prezentując Token Superposition Training (TST) – technikę, która pozwala modelowi o skali 10B parametrów osiągnąć lepsze wyniki przy zużyciu 4768 godzin GPU B200, zamiast standardowych 12 311.

To nie jest kolejna teoretyczna ciekawostka, ale brutalnie skuteczna optymalizacja pętli treningowej. W przeciwieństwie do konkurencyjnych rozwiązań, TST nie wymaga zmiany architektury modelu, optymalizatora ani tokenizera. Po zakończeniu procesu otrzymujemy standardowe LLM, które na etapie inferencji zachowuje się dokładnie tak samo jak modele trenowane klasycznie, ale kosztowało ułamek ich ceny.

Dwie fazy, jeden cel

Mechanizm TST dzieli trenowanie na dwa asymetryczne etapy:

  • Faza superpozycji (0,2 – 0,4 czasu): Model zamiast pojedynczych tokenów otrzymuje ich „worki” (ang. bags). Ich embeddingi są uśredniane do jednej reprezentacji latentnej.
  • Faza odzyskiwania (ang. recovery): Model wraca do standardowego przewidywania następnego tokenu, wykorzystując fundamenty zbudowane na skompresowanych danych.

To kluczowy moment: w pierwszej fazie model przetwarza nawet 16-krotnie więcej tekstu przy tym samym budżecie obliczeniowym. Każdy krok treningowy kosztuje tyle samo FLOP-ów, co w metodzie bazowej, ale zawiera w sobie gigantycznie większą dawkę informacji semantycznej.

Paradoks wydajności kontra dane

TST nie jest jednak darmowym obiadem. To rozwiązanie skrojone pod scenariusze ograniczone obliczeniowo (ang. compute-bound), gdzie moc obliczeniowa jest wąskim gardłem, a danych mamy pod dostatkiem.

Jeśli Twoim problemem jest brak unikalnych danych treningowych, TST Ci nie pomoże. Dlaczego? Ponieważ w fazie superpozycji model „zużywa” tokeny znacznie szybciej. To strategiczny handel: oddajemy nadmiarowe dane w zamian za radykalne skrócenie czasu pracy procesorów graficznych.

Gdzie ukryto haczyk?

Krytyczna analiza wyników pokazuje, że sukces TST opiera się na ciągłości reprezentacji. Próby reinicjalizacji warstw embeddingów przy przejściu między fazami kończą się katastrofą – strata (ang. loss) szybuje w górę, a cały zysk z pierwszej fazy wyparowuje. Model musi „pamiętać” geometrię przestrzeni tokenów, którą wypracował podczas pracy na ich uśrednionych grupach.

Interesujące jest również to, że TST działa tam, gdzie zawodzi popularne Multi-Token Prediction (MTP). O ile MTP często degraduje wyniki mniejszych modeli (poniżej 1B), o tyle TST wykazuje stabilne zyski w pełnym spektrum – od 270M do 10B parametrów.

Werdykt redakcji

Nous Research udowodniło, że optymalizacja AI wciąż ma ogromne rezerwy w samym sposobie podawania danych, a nie tylko w krzemie. TST to rzadki przypadek innowacji, która jest natychmiastowo gotowa do wdrożenia w istniejących pipeline’ach, takich jak TorchTitan czy FSDP.

Dla branży to jasny sygnał: przyszłość uczenia wstępnego należy do metod, które potrafią „oszukać” matematykę tokenów, zanim ta trafi do wnętrza transformera.