SEA-LION V4: Nowy model multimodalny AI wspiera języki Azji Południowo-Wschodniej
AI Singapore (AISG), we współpracy z Google, udostępniło SEA-LION v4, model językowy multimodalny działający na zasadach open-source. Oparty na architekturze Gemma 3 (27B), model ten został zaprojektowany z myślą o wsparciu języków Azji Południowo-Wschodniej, w tym tych z ograniczonymi zasobami cyfrowymi. SEA-LION v4 oferuje funkcje rozumienia zarówno tekstu, jak i obrazu, a jego licencja pozwala na komercyjne wykorzystanie. Co istotne, model jest zoptymalizowany pod kątem łatwego wdrożenia na standardowych platformach sprzętowych.
W testach porównawczych na SEA-HELM – zestawie narzędzi do testowania modeli w językach Azji Południowo-Wschodniej – SEA-LION v4 osiągnął znakomite rezultaty. W zadaniach obejmujących język birmański, filipiński, indonezyjski, malajski, tamilski, tajski i wietnamski, v4 uplasował się na szczycie wśród modeli z parametrami poniżej 200 miliardów, a globalnie zajął 5. miejsce na 55 testowanych modeli.
Wynik ten jest imponujący, zwłaszcza że SEA-LION v4 nie tylko przewyższa modele open-source, takie jak Llama 3, Qwen 3 i Gemma 3, ale także skutecznie konkuruje z modelami komercyjnymi o znacznie większej liczbie parametrów. Przykładowo, w języku filipińskim SEA-LION v4 osiągnął wynik 74.53 w porównaniu do 74.09 dla Gemma 3-27B. Podobnie w języku malajskim wyniki wyniosły odpowiednio 71.31 i 71.20, a w tamilskim 68.47 i 68.45. W języku birmańskim SEA-LION v4 (57.18) minimalnie ustąpił Gemma 3 (57.78), ale pokonał Llama 4 MoE (109B). W wielu językach SEA-LION v4 dorównuje lub przewyższa modele o 3–10 razy większe.
Ta kombinacja efektywności i możliwości czyni go jednym z najwydajniejszych otwartych modeli wielojęzycznych dostępnych zarówno dla badań, jak i zastosowań komercyjnych.
Kluczowe cechy SEA-LION V4
SEA-LION v4 wprowadza szereg ulepszeń technicznych, które czynią go wyjątkowo użytecznym zarówno w regionie Azji Południowo-Wschodniej, jak i globalnie:
- Open Source: SEA-LION v4 jest udostępniany na licencji Gemma, co obniża bariery wejścia dla startupów, badaczy i przedsiębiorstw. Model można pobrać z Hugging Face (modele bazowe i dostrojone), Google Cloud Vertex AI, AWS SageMaker, Kaggle, NVIDIA NIM i Ollama.
- Wydajność i skalowalność: Pomimo 27 miliardów parametrów, SEA-LION v4 został zaprojektowany tak, aby działać praktycznie wszędzie. Dzięki kwantyzacji do FP4 i FP8, model charakteryzuje się tylko niewielkim spadkiem wydajności (poniżej 0.5%) w porównaniu z pełną precyzją, a jednocześnie oferuje do 50% szybszą inferencję. Możliwe jest uruchomienie go na sprzęcie konsumenckim, takim jak laptop z 32 GB pamięci RAM.
- Multimodalność: SEA-LION v4 to pierwsze multimodalne wydanie inicjatywy. Oprócz generowania i rozumienia tekstu, model potrafi „widzieć”, interpretować obrazy i łączyć informacje multimodalne w odpowiedziach. Jest to szczególnie przydatne w analizie i tłumaczeniu dokumentów z osadzonymi obrazami, odpowiadaniu na pytania na podstawie obrazów w językach lokalnych oraz w interaktywnych przepływach pracy wymagających kontekstu tekstowego i wizualnego. Model obsługuje okno kontekstowe o długości 128 tysięcy tokenów, co umożliwia analizowanie długich dokumentów, transkrypcji lub wieloetapowych zapytań.
- Interakcje: SEA-LION v4 oferuje narzędzia wykraczające poza generowanie języka, w tym możliwość wywoływania funkcji (integracja z zewnętrznymi API i agentami), generowanie ustrukturyzowanych wyników (JSON i formaty zgodne ze schematami) oraz kompatybilność z przepływami pracy popularnymi we wdrażaniu LLM w przedsiębiorstwach.
Trening i dane
SEA-LION v4 został wytrenowany na ponad bilionie tokenów, z dużym naciskiem na wyselekcjonowany zbiór danych z Azji Południowo-Wschodniej. Dzięki temu model radzi sobie wyjątkowo dobrze z językami regionalnymi o niskich zasobach, dialektami i kontekstami kulturowymi, gdzie globalne modele często zawodzą. W zadaniach SEA-HELM w językach filipińskim, malajskim, tamilskim i birmańskim, SEA-LION v4 konsekwentnie znajduje się wśród najlepiej ocenianych modeli we wszystkich zakresach parametrów.
Model, dziedzicząc silne ogólne rozumowanie Gemma, pozostaje konkurencyjny w zadaniach wykonywanych w języku angielskim i w zadaniach globalnych, co czyni go uniwersalnym wyborem do wdrożenia.
SEA-LION v4 pokazuje, jak modele z 27 miliardami parametrów, zoptymalizowane i wytrenowane na danych specyficznych dla danej dziedziny, mogą osiągać konkurencyjne wyniki w zadaniach wielojęzycznych. Model oferuje wydajność wielojęzyczną, możliwości multimodalne, otwartą licencję i możliwość wdrażania na różnych platformach, przyczyniając się do postępu w regionalnych modelach AI.
