LLM

Google DeepMind zmienia reguły gry: DiffusionGemma pokazuje, że nie trzeba szkolić modeli od zera

Współczesne modele językowe przyzwyczaiły nas do przewidywania tekstu słowo po słowie. Ten autoregresyjny paradygmat, choć skuteczny, narzuca ograniczenia wydajnościowe i logiczne. Google DeepMind w swoim najnowszym raporcie dotyczącym DiffusionGemma udowadnia jednak, że istnieje alternatywna ścieżka. Zamiast budować nowy system od podstaw, inżynierowie przekształcili istniejący model Gemma 4 w jednostkę dyfuzyjną, wykorzystując do tego ułamek pierwotnego budżetu obliczeniowego.

To podejście zyskuje na znaczeniu właśnie teraz, gdy branża szuka sposobów na ominięcie kosztownych treningów od zera. Dzięki wykorzystaniu dyskretnej dyfuzji, eksperymentalny model o potężnej skali 25,2 mld parametrów udowadnia, że można radykalnie przyspieszyć generowanie treści bez marnowania ogromnych zasobów na ponowne uczenie fundamentów języka. Jak informuje Google DeepMind, system potrafi generować całe bloki tekstu jednocześnie, zamiast przewidywać je sekwencyjnie.

Przełamanie schematu sekwencyjnego

Kluczową innowacją DiffusionGemma jest odejście od generowania pojedynczych tokenów na rzecz równoległego przetwarzania danych. Model potrafi udoskonalać sekwencje liczące 256 tokenów jednocześnie. Efekty są widoczne w statystykach: na akceleratorze Nvidia H100 system osiąga prędkość 1500 tokenów na sekundę. „Zamiast przewidywać słowo po słowie, generuje całe bloki tekstu jednocześnie, zapewniając do 4 razy szybsze generowanie tekstu na procesorach graficznych” – wyjaśnia zespół w oficjalnym komunikacie na blogu Google.

Magia dwuetapowej transformacji

Proces konwersji oparto na dwóch etapach. Najpierw model uczył się rekonstrukcji zaszumionych bloków tekstu, a następnie przeszedł fazę SD·RL – połączenie uczenia ze wzmocnieniem oraz destylacji samplera. O ile pierwszy komponent podnosi jakość merytoryczną, o tyle drugi drastycznie redukuje liczbę kroków obliczeniowych niezbędnych do uzyskania wyniku. Co ciekawe, DiffusionGemma generuje odpowiedzi o połowę krótsze niż jej pierwowzór, co premiuje ją w zadaniach wymagających konkretu.

Dwukierunkowa logika i korekta błędów

Jedną z bolączek tradycyjnych LLM-ów jest brak możliwości cofnięcia raz postawionego znaku. Jeśli model pomyli się na początku obliczenia, często brnie w błąd do końca. DiffusionGemma pracuje nad całą odpowiedzią jednocześnie. W testach matematycznych potrafi poprawić błędny wynik w trakcie procesu odszumiania, zanim zostanie on wyświetlony. Ta cecha sprawia, że model radzi sobie z zadaniami strukturalnymi, takimi jak rozwiązywanie Sudoku – zadaniem, na którym bazowa Gemma 4 poległa.

Eksperymentalny charakter i kompromisy

Mimo sukcesów, Google DeepMind zaznacza: DiffusionGemma to projekt badawczy. Model ma słabości, jak sporadyczne pętle powtórzeń czy problemy z domykaniem sekcji rozumowania. W benchmarkach wypada też słabiej niż bazowy wariant 26B A4B w niektórych zadaniach językowych. Ponadto przewaga szybkości zaciera się, gdy system musi obsługiwać ponad 32 zapytania naraz. Niemniej, udostępnienie wag modelu na licencji Apache 2.0 na platformie Hugging Face otwiera drzwi dla innowacji w rozpoznawaniu mowy czy analizie raportów medycznych.