EmbeddingGemma 2: modularny model od Google DeepMind mapuje multimedia na wspólną przestrzeń
Google DeepMind udostępniło EmbeddingGemma 2 — otwarty model embeddingowy, który przekształca tekst, kod, obrazy, wideo oraz dźwięk we wspólną, 768-wymiarową przestrzeń wektorową. W pełnej konfiguracji model liczy 740 mln parametrów, a jego wagi opublikowano na licencji Apache 2.0.
Główną cechą nowej architektury jest jej modularność. Zamiast monolitycznej struktury Google zastosowało bazowy moduł tekstowo-kodowy o wielkości 270 mln parametrów, do którego można opcjonalnie dołączyć koder obrazu (170 mln parametrów) oraz koder audio (300 mln parametrów). W zależności od potrzeb system może działać w wariancie wyłącznie tekstowym (270 mln), z obsługą obrazu (440 mln), dźwięku (570 mln) lub w pełnej wersji multimodalnej (740 mln).
Wspólna przestrzeń wektorowa w praktyce
Kluczową zaletą tego podziału jest fakt, że wszystkie konfiguracje generują wektory w tej samej przestrzeni 768-wymiarowej. Oznacza to, że baza danych zawierająca zdjęcia, nagrania dźwiękowe czy wideo może zostać wcześniej zindeksowana za pomocą pełnego, 740-milionowego modelu multimodalnego, podczas gdy użytkownik formułujący zapytanie tekstowe może korzystać wyłącznie z lżejszego wariantu o wielkości 270 mln parametrów.
Takie rozwiązanie pozwala ograniczyć zapotrzebowanie na pamięć i moc obliczeniową po stronie urządzenia generującego zapytanie, bez konieczności rezygnacji z przeszukiwania zasobów multimedialnych. Całkowite okno kontekstu modelu wynosi 8192 tokeny i obejmuje łącznie wszystkie wprowadzane dane. Zgodnie z dokumentacją Google budżet ten odpowiada około 29 obrazom, 58 klatkom wideo lub 5,5 minuty materiału dźwiękowego.
Wyniki testów i wymagania sprzętowe
W opublikowanych przez Google wynikach testów największą zmianę względem pierwszej wersji modelu widać w wyszukiwaniu kodu: w benchmarku MTEB Code v1 EmbeddingGemma 2 uzyskał 78,68 punktu wobec 68,76 w wydaniu pierwotnym. W przypadku testu wielojęzycznego MTEB v2 różnica okazała się minimalna — wynik wzrósł z 61,15 do 61,36 punktu. W materiałach udostępniono również rezultaty dla danych wizualnych (64,64 w MIEB lite, 59,01 w MMEB v2) oraz dźwięku (69,54 w MSEB), jednak brakuje jeszcze niezależnych testów weryfikujących jakość wyszukiwania bezpośrednio pomiędzy różnymi mediami. Same podane wyniki pochodzą z materiałów producenta — nie zostały niezależnie zweryfikowane, a brakuje też szczegółów pozwalających jednoznacznie ocenić, czy porównania z innymi modelami przeprowadzono w równoważnych warunkach.
Według danych Google AI Edge skwantyzowany model w wersji wyłącznie tekstowej zajmuje około 191 MB aktywnej pamięci RAM na smartfonie Pixel 11 Pro, natomiast pełna konfiguracja multimodalna wymaga w tym samym środowisku około 567 MB. Wagi modelu można pobrać m.in. z platform Hugging Face i Kaggle, a wdrożenie ułatwia bezpośrednia obsługa przez narzędzia takie jak Ollama czy llama.cpp.
