Krótkowzroczność algorytmów: Dlaczego AI wciąż nie potrafi patrzeć?
Myślimy, że sztuczna inteligencja popełnia błędy, bo źle wyciąga wnioski. Prawda jest jednak bardziej prozaiczna: ona po prostu nie widzi tego, co jej pokazujemy. Najnowszy raport zespołu Moonshot AI, który opublikował zestaw testowy PerceptionBench, obnaża fundamentalną słabość modeli multimodalnych. Okazuje się, że to, co braliśmy za deficyt logiki, jest w rzeczywistości „wąskim gardłem” na etapie samej percepcji obrazu.
Dlaczego to ważne właśnie teraz
Publikacja PerceptionBench zmienia sposób, w jaki oceniamy postęp w branży. Zamiast testować ogólną wiedzę, badacze wzięli pod lupę 3 000 zweryfikowanych pytań, z czego aż 1 800 pochodzi bezpośrednio z błędów zidentyfikowanych w 42 innych, istniejących benchmarkach. Wyniki są otrzeźwiające: w świecie, gdzie AI ma diagnozować nowotwory czy sterować dronami, żaden z 16 testowanych modeli nie przebił bariery 60 procent skuteczności w czystym widzeniu.
Kryzys percepcji w dobie GPT-5 i Claude Fable
Od dawna panowało przekonanie, że halucynacje AI to problem procesów myślowych. Moonshot AI udowodniło, że jest inaczej. PerceptionBench to rygorystyczny zestaw testów izolujący czystą percepcję od wiedzy zewnętrznej. Jak podkreślają autorzy, to „test, który oddziela wzrok od rozumowania logicznego”. Efekt? Sztuczna inteligencja wykłada się na rzeczach, które dla trzylatka są oczywiste.
Analiza wyników pokazuje brutalną prawdę. GPT-5.6 Sol, obecny lider zestawienia, wycisnął zaledwie 59,7 procent punktów. Jeszcze gorzej wypadają inne modele, jak Kimi K3 z wynikiem 58,5 procent. Te liczby stawiają pod znakiem zapytania gotowość systemów do pracy w miejscach, gdzie precyzja wizualna decyduje o bezpieczeństwie.
Dziesięć wymiarów porażki
Badacze podzielili percepcję na dziesięć „atomowych” umiejętności. Wśród nich znalazły się relacje przestrzenne, liczenie obiektów, lokalizacja czy odczytywanie tekstu (OCR). Największą kompromitacją okazały się jednak halucynacje wizualne. GPT-5.6 Sol w teście sprawdzającym, czy model wymyśla nieistniejące obiekty, zanotował wynik na poziomie 26,9 procent. Paradoksalnie, znacznie prostszy Gemini 3.5 Flash poradził sobie w tym aspekcie niemal dwukrotnie lepiej.
Skąd te problemy? Dane wizualne muszą zostać „przetłumaczone” na kod zrozumiały dla komponentów językowych. Podczas tej operacji dochodzi do gigantycznej utraty wierności. Modele gubią się przy określaniu godziny na tradycyjnej tarczy zegara czy liczeniu kwiatów w pudełku. To nie błąd w myśleniu, to błąd odczytu danych wejściowych.
Koniec z przecenianiem maszyn
PerceptionBench to obecnie najbardziej kompleksowy akt oskarżenia wobec wzroku AI. Wcześniejsze próby, jak WorldVQA czy BabyVision, również sygnalizowały problem. W zadaniach na poziomie rozwoju wczesnodziecięcego ludzie osiągają 94 procent skuteczności. Najlepsze AI zatrzymują się w połowie stawki, wykazując przy tym niebezpieczną, nadmierną pewność siebie.
„Udostępniamy PerceptionBench jako benchmark, który izoluje percepcję wizualną i ocenia ją jako zestaw atomowych zdolności” – deklaruje zespół Moonshot AI w dokumentacji na GitHubie. To sygnał dla całej branży: dopóki nie naprawimy fundamentów, nawet najpotężniejsze łańcuchy logiczne będą budowane na kruchym piasku błędnych obserwacji.
