LLM

Mocna wizja AI w smartfonie. Liquid AI rzuca wyzwanie gigantom modelem LFM2.5-VL-3B

Rynek kompaktowych modeli sztucznej inteligencji właśnie doczekał się gracza, który nie prosi o zgodę na wejście. Liquid AI zaprezentowało LFM2.5-VL-3B, wielomodalną jednostkę o 3,1 miliarda parametrów, która rzuca wyzwanie znacznie potężniejszym konstrukcjom. Mimo niewielkich rozmiarów, model potrafi interpretować interfejsy cyfrowe, analizować dokumenty i precyzyjnie lokalizować obiekty w przestrzeni ekranowej. To otwiera drzwi dla autonomicznych agentów działających bezpośrednio na smartfonach i laptopach, bez wysyłania każdego bajtu danych do chmury.

Dlaczego to ważne teraz

Premiera LFM2.5-VL-3B to sygnał, że wyścig na parametry traci na znaczeniu na rzecz czystej wydajności lokalnej. Według danych Hugging Face, model ten odpowiada bezpośrednio, zamiast tracić czas na budowanie łańcuchów rozumowania, co pozwala na płynną pracę w aplikacjach działających w czasie rzeczywistym. Liquid AI określa go jako swój „najbardziej zaawansowany model wizyjno-językowy” do tej pory, koncentrując się na obsłudze strumieni danych na urządzeniach o ograniczonych zasobach sprzętowych.

Precyzja godna większych modeli

Nowa propozycja od Liquid AI wyróżnia się przede wszystkim sprawnością w obsłudze interfejsów graficznych (GUI). Testy przeprowadzone na benchmarku ScreenSpot-v2 wykazały średni wynik na poziomie 80,7 punktów. To wynik, który stawia LFM2.5-VL-3B przed takimi konkurentami jak Gemma-4-E4B czy Qwen3.5-4B. Model nie tylko widzi zawartość ekranu, ale przekłada ją na konkretne współrzędne. Skok precyzji w zadaniach typu grounding — z 57,1 do niemal 88 punktów w skali RefCOCO — sugeruje, że mamy do czynienia z jedną z najlepiej zoptymalizowanych małych jednostek na rynku.

Architektura bez zbędnego myślenia

Pod maską LFM2.5-VL-3B kryje się innowacja. Wykorzystanie enkodera SigLIP2 NaFlex pozwala na przetwarzanie obrazów w natywnej rozdzielczości bez utraty detali. Liquid AI świadomie zrezygnowało z architektury typu „reasoning”. Zamiast generować czasochłonne łańcuchy myślowe, model reaguje natychmiastowo. Efekt? Na procesorze Apple M5 Max, jednostka generuje 228 tokenów na sekundę, zajmując zaledwie 3 GB pamięci operacyjnej. Nawet na układach AMD Ryzen AI Max+ 395 prędkość utrzymuje się na poziomie 116 tokenów na sekundę.

Automatyzacja w kieszeni

Nowością jest obsługa wywoływania funkcji (function calling). Algorytm generuje wywołania w składni Pythona, reagując na tekst i obraz. Na podstawie zdjęcia potrawy model może automatycznie sformułować zapytanie do bazy danych z przepisami. Ta funkcjonalność, wsparta obsługą 16 języków, czyni z LFM2.5-VL-3B narzędzie do automatyzacji procesów (RPA) i błyskawicznego OCR. Liquid AI udostępniło model w otwartym formacie dla badaczy i firm o przychodzie poniżej 10 milionów dolarów rocznie. Dzięki wsparciu dla llama.cpp, MLX czy ONNX, programiści mogą wdrażać go od ręki w swoich aplikacjach.