Qwen3.8-Omni-Flash wchodzi na rynek. Multimodalność tańsza niż w Gemini Flash
Rynek modeli multimodalnych zyskuje nową propozycję, która zamiast walczyć wyłącznie parametrami, uderza w strukturę kosztów konkurencji. Qwen3.8-Omni-Flash to konstrukcja stworzona specjalnie pod kątem agentów AI, zdolna do jednoczesnego przetwarzania obrazu oraz dźwięku. Model radzi sobie z zadaniami takimi jak montowanie wideo, tłumaczenie materiałów filmowych czy streszczanie długich nagrań, wykorzystując okno kontekstowe o rozmiarze miliona tokenów. Nowa generacja modelu wykazuje przy tym znaczący postęp technologiczny względem swojego poprzednika – w serii 29 zróżnicowanych ewaluacji Qwen3.8-Omni-Flash uzyskał średni wynik lepszy o ponad 25% w porównaniu z wersją Qwen3.5-Omni-Plus.
Benchmarki zbliżone, ceny bezkonkurencyjne
Według deklaracji twórców, Qwen3.8-Omni-Flash w testach multimodalnych osiąga wyniki porównywalne z Gemini 1.5 Flash od Google, a w niektórych metrykach, jak OmniVideoBench, notuje wyraźne wzrosty wydajności. Szczegółowe dane z tego testu potwierdzają przewagę: dokładność modelu wzrosła z poziomu 63,4 do 67,8. Równocześnie optymalizacja architektury pozwoliła na redukcję zużycia tokenów o dokładnie 45,7% względem poprzedniej generacji.
Kluczowa różnica ujawnia się jednak w cenniku API. Koszt miliona tokenów wejściowych w Qwen to zaledwie 0,15 USD, a wyjściowych – 0,47 USD. Dla porównania, Google Gemini Flash w promocyjnej cenie kosztuje odpowiednio 0,75 USD i 3,75 USD. W praktyce przekłada się to na drastyczne oszczędności przy przetwarzaniu multimediów:
- Godzina analizy audio kosztuje mniej niż jeden cent.
- Analiza wideo w rozdzielczości 720p (przy jednej klatce na sekundę) wraz z dźwiękiem to wydatek rzędu 0,20 USD.
- Średni koszt wejścia audio spadł o ponad 98% względem poprzednich generacji, a koszt wejścia audio-wideo został zredukowany o ponad 93% w porównaniu z wcześniejszymi rozwiązaniami.
Ekosystem dla programistów
Model jest dostępny przez Qwen Studio oraz API, ale twórcy stawiają również na integrację z istniejącymi narzędziami. Zestaw wtyczek Qwen-MM-Plugins pozwala na wdrożenie funkcji takich jak rozpoznawanie mówców czy generowanie notatek z plików PDF w środowiskach programistycznych, w tym Claude Code. Z kolei rozwiązanie Qwen-Live Harness umożliwia interakcję z modelem w czasie rzeczywistym przy użyciu kamery i mikrofonu, co pozycjonuje narzędzie jako fundament dla asystentów działających na żywo.
