LLM

Google przyspiesza Gemmę 4. Technologia Multi-Token Prediction potroi tempo pracy modelu

Tradycyjna architektura dużych modeli językowych (LLM) opiera się na sekwencyjnym generowaniu treści – słowo po słowie, a konkretnie token po tokenie. Każdy taki krok wymaga od procesora załadowania miliardów parametrów z pamięci operacyjnej, co w praktyce oznacza, że jednostki obliczeniowe spędzają większość czasu w stanie bezczynności, czekając na transfer danych. Google postanowiło przełamać ten impas, udostępniając technologię Multi-Token Prediction (MTP) dla swojej otwartoźródłowej rodziny modeli Gemma 4.

Inteligentne wypełnianie luk obliczeniowych

Kluczem do oferowanego przyspieszenia jest wykorzystanie tak zwanych pomocniczych modeli szkicujących (drafters). W momencie, gdy główny model oczekuje na dane, mniejsza i szybsza jednostka wykorzystuje wolne zasoby, by zaproponować kilka kolejnych tokenów jednocześnie. Zamiast weryfikować każde słowo z osobna, model główny sprawdza cały zaproponowany ciąg w ramach jednego przebiegu obliczeniowego. Jeśli propozycje są trafne, zostają natychmiast zatwierdzone, co drastycznie skraca czas potrzebny na sformułowanie pełnej odpowiedzi.

Co istotne z punktu widzenia inżynierii systemowej, Google deklaruje, że ta metoda nie wpływa negatywnie na jakość ani dokładność generowanych treści. Model pomocniczy operuje jedynie w „oknach czasowych”, które do tej pory były marnowane, pełniąc rolę akceleratora, a nie autonomicznego twórcy tekstu.

Dostępność i implementacja

Nowe rozwiązanie charakteryzuje się dużą uniwersalnością – wzrost wydajności jest odczuwalny zarówno w chmurze, jak i na urządzeniach lokalnych, w tym smartfonach i komputerach osobistych. To strategiczny ruch Google, mający na celu umocnienie pozycji Gemmy w ekosystemie open source. Modele szkicujące zostały udostępnione na licencjach Apache 2.0 i można je pobrać z platform Hugging Face oraz Kaggle.

Biorąc pod uwagę fakt, że wydana na początku kwietnia Gemma 4 została pobrana już ponad 60 milionów razy, wprowadzenie mechanizmu MTP może stać się nowym standardem w optymalizacji modeli o otwartych wagach. Dla deweloperów oznacza to przede wszystkim mniejsze opóźnienia i niższe koszty infrastrukturalne przy zachowaniu wysokiej klasy rezultatów.