Gemma 4 w wersji QAT: Google rzuca wyzwanie ograniczeniom pamięci mobilnej
Zatkana pamięć RAM w smartfonie przestaje być barierą dla zaawansowanej sztucznej inteligencji. Google DeepMind udostępniło właśnie nowe warianty modelu Gemma 4, które wykorzystują technikę Quantization-Aware Training (QAT). To nie jest po prostu kolejna optymalizacja. To próba przeniesienia ciężaru z gigantycznych serwerowni bezpośrednio do naszych kieszeni i na domowe laptopy.
Dlaczego to ważne teraz? Google wyraźnie przesuwa punkt ciężkości z modeli chmurowych na lokalne. Premiera nowych punktów kontrolnych, która miała miejsce 5 czerwca 2026 roku, pokazuje, że przyszłość AI to nie tylko potężne klastry obliczeniowe, ale przede wszystkim sprzęt konsumencki zdolny do autonomicznej pracy bez opóźnień wynikających z przesyłania danych do sieci.
Dlaczego QAT zmienia reguły gry?
Kluczem do zrozumienia nowości od Google jest różnica między standardową kwantyzacją po treningu (PTQ) a metodą QAT. Podczas gdy PTQ kompresuje gotowy model, co często skutkuje zauważalną degradacją jego ‐inteligencji‐, QAT symuluje proces kwantyzacji już na etapie trenowania. Zespół Google AI for Developers wyjaśnia to prosto: ‐QAT integruje symulację kwantyzacji w sam proces treningowy‐. Dzięki temu sieć neuronowa uczy się kompensować straty precyzji w locie.
Efekt? Google deklaruje, że wyniki QAT wykazują nawet wyższą ogólną jakość w porównaniu do standardowych punktów odniesienia PTQ, zbliżając się do poziomu oryginału bfloat16 przy ułamku jego wagi. W praktyce oznacza to około 72% mniejsze zużycie pamięci przy zachowaniu niemal identycznej precyzji odpowiedzi.
Nowy standard dla urządzeń mobilnych
Największe emocje budzi nowy format mobilny. Pozwala on odchudzić model E2B z bazowych 9,6 GB do zaledwie około 1 GB. Inżynierowie osiągnęli to dzięki zastosowaniu czterech technik: statycznych aktywacji, kwantyzacji kanałowej dopasowanej do mobilnych akceleratorów, celowanej 2-bitowej kompresji warstw generujących oraz optymalizacji pamięci podręcznej KV. Dla programistów szukających ekstremalnej wydajności dostępna jest wersja tekstowa, która po usunięciu enkoderów wizji i dźwięku zajmuje mniej niż gigabajt danych. To otwiera drzwi dla zaawansowanej AI nawet na starszych smartfonach.
Wybór formatu a docelowy sprzęt
Wybór między dostępnymi formatami zależy od mocy obliczeniowej pod ręką. Format Q4_0 QAT staje się nowym standardem dla laptopów i domowych komputerów z kartami graficznymi, redukując wagę modelu E4B do poręcznych 5 GB. Z kolei format mobilny, mimo pewnych kompromisów jakościowych w warstwach 2-bitowych, oferuje bezprecedensową szybkość dekodowania.
Modele są już dostępne na platformie Hugging Face i wspierają popularne ekosystemy takie jak llama.cpp, Ollama czy LiteRT-LM. Jak twierdzi Google w oficjalnym komunikacie na blog.google: ‐nasze wyniki QAT dają nawet wyższą ogólną jakość w porównaniu ze standardowymi bazami PTQ‐. To jasny sygnał: era lokalnej AI właśnie przestała być teorią, a stała się faktem instalacyjnym.
