Alibaba Qwen 3.8 Max dogania czołówkę, ale płaci za to wysoką cenę
Nowa odsłona modelu językowego od Alibaba Cloud, Qwen 3.8 Max, zanotowała gwałtowny skok w rankingach wydajności, osiągając 56 punktów w Artificial Analysis Intelligence Index. Wynik ten stawia chiński system na równi z Claude Opus 4.8 i pozwala wyprzedzić GLM-5.2. Choć na papierze wygląda to na spektakularny sukces, bliższa analiza kosztów i architektury procesu ujawnia, że za wysoką punktacją kryje się radykalne zwiększenie zapotrzebowania na zasoby.
Dla firm wdrażających rozwiązania AI to sygnał ostrzegawczy: sama pozycja w benchmarkach przestaje być jedynym wyznacznikiem sukcesu. W świecie rzeczywistych wdrożeń liczy się koszt pojedynczego zadania i przewidywalność odpowiedzi, a tutaj Qwen 3.8 Max zalicza bolesne potknięcie. Jak zauważa serwis The Decoder: „Qwen 3.8 Max wykonuje teraz aż 64 kroki na każde zadanie zamiast dotychczasowych 14”, co drastycznie wydłuża czas pracy i zwiększa liczbę przetwarzanych tokenów.
Ambicje kontra efektywność ekonomiczna
Szczególnie imponująco Qwen prezentuje się w benchmarku GDPval-AA, symulującym zadania zawodowe. Model zanotował tam przyrost aż o 468 punktów Elo, osiągając poziom 1739. W tym konkretnym zestawieniu Alibaba wyprzedziła konkurencyjnego Kimi K3, ustępując miejsca jedynie najpotężniejszemu Claude Opus 5. Jednak ta pogoń za liderami wymusiła zmianę sposobu „myślenia” modelu, co negatywnie odbija się na rachunkach użytkowników.
Finansowe konsekwencje „dokładności”
Mimo że Alibaba obniżyła cennik za milion tokenów (wejściowe spadły do 2,00 USD, wyjściowe do 6,00 USD), realny koszt wykonania pojedynczej operacji w Intelligence Index wzrósł ponad dwukrotnie – z 0,53 USD do 1,14 USD. Dla porównania, konkurencyjny Kimi K3 nie tylko uzyskał o jeden punkt wyższy wynik ogólny, ale robi to przy koszcie zaledwie 0,86 USD za zadanie. To stawia pod znakiem zapytania opłacalność wdrożenia najnowszego modelu Qwen w systemach wymagających masowego przetwarzania danych, gdzie każda setna centa ma znaczenie.
Regres w rzetelności: problem halucynacji
Najbardziej niepokojące dla inżynierów i analityków są jednak spadki w testach jakościowych. Qwen 3.8 Max gorzej radzi sobie z wyciąganiem wniosków z bardzo długich dokumentów (spadek AA-LCR), ale prawdziwym wyzwaniem jest metryka AA-Omniscience. Model stracił aż 10 punktów w tej kategorii, co wynika z drastycznego wzrostu wskaźnika halucynacji – z 23% do 40%.
Zamiast szczerze przyznać się do braku wiedzy, nowa wersja systemu znacznie częściej „zgaduje” odpowiedzi. W praktyce oznacza to, że choć model stał się potężniejszy w zadaniach logicznych i zawodowych, stał się jednocześnie mniej wiarygodnym źródłem informacji. Dla sektora enterprise, gdzie pomyłka w analizie dokumentów może kosztować miliony, tak wysoki poziom halucynacji może być barierą nie do przejścia.
