Gen AITechnologia

Liquid AI prezentuje LFM2-VL: przełomowe modele wizyjno-językowe do zastosowań na urządzeniach

Liquid AI, firma specjalizująca się w rozwiązaniach sztucznej inteligencji, zaprezentowała LFM2-VL, nową rodzinę modeli wizyjno-językowych (Vision-Language Models – VL), które obiecują znacząco przyspieszyć i usprawnić implementację AI na urządzeniach brzegowych (edge computing) i mobilnych.

Modele LFM2-VL, dostępne w dwóch wariantach – LFM2-VL-450M i LFM2-VL-1.6B – zostały zaprojektowane z myślą o minimalnych opóźnieniach i optymalnym wykorzystaniu zasobów sprzętowych. To sprawia, że nadają się idealnie do zastosowań w smartfonach, laptopach, urządzeniach noszonych (wearables) oraz systemach wbudowanych, gdzie szybkość działania i energooszczędność są kluczowe.

Innowacyjna architektura dla maksymalnej wydajności

LFM2-VL wyróżniają się modułową architekturą, która łączy model językowy (LFM2-1.2B lub LFM2-350M), koder wizyjny SigLIP2 NaFlex (400M lub 86M parametrów) oraz multimodalny projektor wykorzystujący technikę „pixel unshuffle”. To innowacyjne połączenie pozwala na dynamiczne redukowanie liczby tokenów obrazu, co przekłada się na znaczne przyspieszenie przetwarzania.

Modele potrafią przetwarzać obrazy w natywnej rozdzielczości do 512×512 pikseli bez konieczności skalowania, co pozwala zachować szczegóły i proporcje. Większe obrazy są dzielone na nie nakładające się fragmenty, a model 1.6B dodatkowo koduje miniaturę całego obrazu, aby uwzględnić kontekst globalny sceny.

Użytkownicy mogą dostosowywać balans między szybkością a jakością działania modelu, regulując maksymalną liczbę tokenów obrazu i fragmentów. Taka elastyczność pozwala na optymalne dopasowanie LFM2-VL do możliwości konkretnego urządzenia i wymagań aplikacji.

Wyniki benchmarków i otwarte oprogramowanie

LFM2-VL osiągają konkurencyjne wyniki w testach porównawczych, takich jak RealWorldQA, MM-IFEval i OCRBench, dorównując większym modelom, takim jak InternVL3 i SmolVLM2. Co istotne, robią to przy znacznie mniejszym zapotrzebowaniu na pamięć i krótszym czasie przetwarzania, co czyni je idealnym rozwiązaniem dla urządzeń brzegowych i mobilnych.

Oba warianty modelu są dostępne na platformie Hugging Face na zasadach licencji Apache 2.0, co oznacza, że mogą być bezpłatnie wykorzystywane zarówno do celów badawczych, jak i komercyjnych. Większe przedsiębiorstwa, które planują zastosowanie modeli w bardziej rozbudowanych systemach, powinny skontaktować się z Liquid AI w celu uzyskania licencji komercyjnej.

Potencjalne zastosowania

LFM2-VL otwierają nowe możliwości dla twórców aplikacji w wielu dziedzinach, takich jak robotyka, Internet Rzeczy (IoT), inteligentne kamery, mobilni asystenci i inne. Przykładowe zastosowania obejmują generowanie podpisów do obrazów w czasie rzeczywistym, wyszukiwanie wizualne oraz interaktywne chatboty multimodalne.

Podsumowując, LFM2-VL to innowacyjne modele wizyjno-językowe, które dzięki swojej wydajności, elastyczności i dostępności, mają szansę zrewolucjonizować sposób, w jaki wykorzystujemy sztuczną inteligencję na urządzeniach mobilnych i brzegowych.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *