Koniec dyktatury lewej strony. ByteDance iLLaDA rzuca wyzwanie modelom autoregresyjnym
ChatGPT i jego klony przyzwyczaiły nas do tego, że tekst powstaje słowo po słowie, w sztywnym porządku od lewej do prawej. Ten paradygmat właśnie pękł. Naukowcy z Uniwersytetu Renmin oraz ByteDance pokazali iLLaDA – model językowy o parametrach 8B, który zamiast przewidywać kolejny token, wykorzystuje mechanizm dyfuzji maskowanej. To podejście, zapożyczone z generatorów grafiki, pozwala systemowi widzieć i przetwarzać całą sekwencję znaków jednocześnie.
Dlaczego to ważne teraz
Premiera iLLaDA to sygnał, że architektura dyfuzyjna przestała być niszowym eksperymentem dla optymalizatorów prędkości. Dzięki wytrenowaniu modelu od zera na gigantycznym zbiorze 12 bilionów tokenów (12T), ByteDance udowodniło, że dwukierunkowe modele mogą realnie konkurować z gigantami takimi jak Qwen2.5 pod względem czystej sprawności intelektualnej. To fundamentalna zmiana: „zamiast przewidywać tokeny jeden po drugim w tej sztywnej sekwencji, funkcja celu działa poprzez agresywne maskowanie i odzyskiwanie wejściowej sekwencji” – tłumaczą autorzy technologii w serwisie YouTube.
Skalowanie zamiast ułatwień
Rynek widział już próby mariażu dyfuzji z tekstem, jak choćby DiffusionGemma od Google, ale iLLaDA idzie o krok dalej. Model nie bazuje na żadnym „rozgrzanym” fundamencie autoregresyjnym. Mimo braku takich ułatwień, iLLaDA-Base w benchmarku BBH uzyskała 63,9 punktu, wyprzedzając Qwen2.5 7B, który zdobył 63,3 pkt. Jeszcze większą przewagę widać w teście ARC-Challenge, gdzie model ByteDance odskoczył konkurencji o blisko 15 punktów. Jak zauważają autorzy oficjalnego opracowania: „wprowadzamy iLLaDA, w pełni dwukierunkowy model dyfuzyjny wytrenowany od zera”.
Bariera instrukcji i matematyki
Choć wersja bazowa imponuje, etap dostrajania instrukcyjnego (fine-tuning) obnaża słabości nowej architektury. Wersja iLLaDA-Instruct z wynikiem 67,1 punktu wyraźnie odstaje od Qwen2.5 7B Instruct (77,1 pkt). „Przeciwko Qwen2.5 wersja Base wygrywa, ale iLLaDA-Instruct wciąż zostaje w tyle” – przyznają badacze. Gdzie leży problem? Głównie w zadaniach matematycznych i kodowaniu. Modele autoregresyjne, wspierane latami rozwoju uczenia ze wzmocnieniem (RLHF), wciąż lepiej radzą sobie z logicznym ciągiem operacji krok po kroku.
Mimo tych niedociągnięć, iLLaDA stanowi kamień milowy. Progres względem poprzednika (LLaDA) jest kolosalny – wynik w teście HumanEval wzrósł o 16,5 punktu. To dowód na to, że dyfuzja maskowana skaluje się świetnie wraz z ilością danych. ByteDance nie zamierza na tym poprzestać, pracując już nad kolejnymi projektami takimi jak Cola DLM, które mają jeszcze mocniej zatrzeć granicę między generowaniem obrazu a głębokim rozumieniem tekstu.
