LLM

Google rzuca wyzwanie dyktaturze tokenów. DiffusionGemma generuje tekst jak obrazy

W świecie modeli językowych (LLM) paradygmat generowania tekstu token po tokenie wydawał się nienaruszalny. Standardowe systemy autoregresyjne cierpią na strukturalne ograniczenie: każdy kolejny wyraz musi pokornie czekać na powstanie poprzedniego. Google DeepMind postanowiło rzucić wyzwanie tej architekturze, prezentując DiffusionGemma. To eksperymentalny system o otwartych wagach, który zamiast układać zdania linearnie, generuje całe bloki tekstu naraz.

Dlaczego to ważne? Branża AI przesuwa środek ciężkości z samej jakości odpowiedzi na ich koszt i przepustowość. W dobie walki o każdy wat energii, możliwość odciążenia pamięci GPU i uruchamiania potężnych modeli na lokalnym sprzęcie staje się priorytetem. DiffusionGemma pokazuje, że zamiast czekać na „wyplucie” każdego słowa, możemy zmusić procesory do pracy równoległej, co drastycznie skraca czas oczekiwania na wynik.

Od informacyjnego szumu do kodu

Mechanizm działania DiffusionGemma czerpie z sukcesów modeli graficznych, takich jak Stable Diffusion. Jak tłumaczy zespół DeepMind, model startuje od zestawu 256 losowych tokenów pełniących rolę „szumu” i iteracyjnie doprowadza go do spójnej formy. „Model zaczyna od szumu i stopniowo przekształca go w czytelny komunikat” – czytamy w dokumentacji projektu. Taka architektura pozwala na jednoczesne przetwarzanie całego bloku danych, co całkowicie zmienia sposób obciążenia krzemu.

Kluczem do wyników jest optymalizacja wykonana we współpracy z Nvidią. Tradycyjne modele podczas pracy w trybie pojedynczego użytkownika często marnują potencjał obliczeniowy kart graficznych, bo są ograniczane przez wolną przepustowość pamięci. DiffusionGemma przenosi ciężar na surową moc obliczeniową. Efekty widać w liczbach: na karcie GeForce RTX 5090 model osiąga tempo ponad 700 tokenów na sekundę, a w profesjonalnych systemach H100 rozpędza się do 1000 tokenów na sekundę. To niemal czterokrotny wzrost wydajności względem klasycznych rozwiązań podobnej skali.

Szybkość ma swoją cenę

Mimo imponujących rekordów prędkości, rozwiązanie to nie jest pozbawione wad. Google otwarcie przyznaje, że DiffusionGemma w testach jakościowych ustępuje swojemu pierwowzorowi – modelowi Gemma 4. Wyraźny kompromis między szybkością a precyzją sprawia, że nowość od DeepMind nie zastąpi na razie asystentów piszących eseje. To raczej narzędzie do zadań specjalnych.

Prawdziwa siła modelu objawia się tam, gdzie tekst nie musi powstawać nudno, od lewej do prawej. Dzięki temu, że każdy token „widzi” cały blok jednocześnie, system idealnie nadaje się do:

  • wstawiania brakujących fragmentów w środku istniejącego tekstu,
  • uzupełniania luk w kodzie programistycznym (infilling),
  • modelowania struktur nieliniowych, np. sekwencji aminokwasów.

Demokratyzacja na licencji Apache

Pod maską DiffusionGemma kryje się 26 miliardów parametrów, jednak dzięki architekturze Mixture-of-Experts (MoE) w każdym kroku aktywnych pozostaje jedynie 3,8 miliarda. To pozwala na uruchomienie modelu w domowych warunkach. Po kwantyzacji system mieści się w 18 GB pamięci VRAM, co czyni go dostępnym dla posiadaczy mocniejszych kart konsumenckich.

Choć technologia pozostaje w fazie eksperymentu, Google udostępniło wagi na licencji Apache 2.0. Wsparcie dla Hugging Face Transformers oraz vLLM sugeruje, że gigant z Mountain View chce, aby środowisko deweloperskie szybko sprawdziło tę ścieżkę w praktyce. Wydaje się, że era „dyfuzyjnego pisania” właśnie przestała być tylko teoretyczną ciekawostką.