Qwen3.8-Omni-Flash: Alibaba wprowadza agentską percepcję wideo
Zespół Qwen należący do Alibaby zaprezentował Qwen3.8-Omni-Flash – swój pierwszy model multimodalny z natywną obsługą tekstu, obrazu, audio i wideo, wyposażony w zaawansowane funkcje agentskie. System nie tylko przyjmuje różnorodne formaty danych, ale przede wszystkim zmienia sposób ich przetwarzania dzięki mechanizmowi agentskiej percepcji.
Inteligentne skanowanie zamiast analizy klatka po klatce
Tradycyjne modele analizujące wideo zazwyczaj przetwarzają materiał sekwencyjnie, co przy długich nagraniach generuje ogromne zużycie tokenów. Qwen3.8-Omni-Flash stosuje podejście coarse-to-fine – model wychodzi od zadanego przez użytkownika pytania i na jego podstawie selektywnie skanuje nagranie, szukając istotnych fragmentów.
Według deklaracji producenta, takie rozwiązanie pozwala na znaczące oszczędności przy jednoczesnym wzroście precyzji. W teście OmniVideoBench model zużył o 45,7% mniej tokenów (spadek z 145 736 do 79 117) niż przy standardowym odczycie, a jego dokładność wzrosła z 63,4 do 67,8 pkt. Należy jednak pamiętać, że są to dane zgłoszone przez dostawcę i wymagają niezależnej weryfikacji.
Parametry techniczne i okno kontekstowe
Model oferuje okno kontekstowe o pojemności niemal 1 miliona tokenów (991 tys. na wejściu oraz 131 tys. na wyjściu). Warto dodać, że obok wspomnianego okna kontekstowego system charakteryzuje się maksymalną długością rozumowania (maksymalna długość rozumowania) wynoszącą 262 tysiące tokenów. System wspiera planowanie zadań i wywoływanie narzędzi, a wyniki swoich analiz zwraca w formie tekstowej. Najważniejsze możliwości modelu obejmują:
- Przetwarzanie wideo o długości do 2 godzin (pliki do 2 GB) i audio do 3 godzin.
- Obsługę 113 języków i dialektów.
- Domyślnie włączony tryb rozumowania (reasoning_effort ustawiony na xhigh).
- Próbkowanie wideo do 15 klatek na sekundę.
Dostępność wyłącznie przez API
W przeciwieństwie do wielu poprzednich projektów Qwen, wersja 3.8-Omni-Flash nie jest dostępna w modelu open-weights. Z modelu można korzystać wyłącznie jako z hostowanego API za pośrednictwem platform QwenCloud oraz Alibaba Cloud Model Studio. Alibaba wprowadziła przy tym agresywną politykę cenową – koszt analizy audio spadł o 98%, a wideo o około 93% w porównaniu do wersji Qwen3.5-Omni-Plus. Cena za milion tokenów wejściowych wynosi 0,15 USD, a za milion wyjściowych 0,47 USD.
Dla programistów udostępniono bibliotekę Qwen-MM-Plugins na licencji Apache-2.0, która ułatwia wdrażanie funkcji multimodalnych. W ramach biblioteki udostępniono gotowe umiejętności, takie jak omni-video2note (do automatycznego tworzenia notatek z wideo) oraz omni-chatcut (do edycji materiałów), co demonstruje praktyczny potencjał integracji wtyczek w codziennych zadaniach. Warto jednak odnotować obecne ograniczenie techniczne: audio w lokalnych narzędziach pomocniczych wciąż wymaga przesyłania do API, co tworzy lukę w pełnej, natywnej obsłudze lokalnej tego formatu.
