Anthropic porównało chiński GLM-5.3 z Claude Mythos. W testach exploitów dzieli je niewiele
Otwarty model GLM-5.3 chińskiej firmy Zhipu AI w wybranych zadaniach tworzenia exploitów osiąga wyniki bliskie Claude Mythos Preview. Tak wynika z analizy opublikowanej przez zespół Frontier Red Team firmy Anthropic. Kluczowa różnica między oboma systemami dotyczy sposobu ich dystrybucji i podatności zabezpieczeń: podczas gdy Mythos Preview udostępniono wąskiej grupie obrońców w ramach Project Glasswing, wagi GLM-5.3 można swobodnie pobrać z sieci, a wbudowane mechanizmy odmowy wykonania szkodliwych poleceń można obejść.
W benchmarku ExploitBench, sprawdzającym zdolność do wykorzystania luk w silniku V8 przeglądarki Chrome, GLM-5.3 przygotował działający exploit w 50 z 410 prób. Mythos Preview odnotował 56 udanych podejść. Z kolei w wewnętrznym teście Anthropic, opartym na projektach open source z repozytorium Google OSS-Fuzz, model Zhipu doprowadził do pełnego przejęcia kontroli nad programem w 4 proc. zadań, podczas gdy Mythos Preview osiągnął 6 proc. Wyniki te dotyczą jednak ściśle zdefiniowanych zadań i nie oznaczają zrównania możliwości modeli we wszystkich operacjach cybernetycznych.
W eksperymentach laboratoryjnych Anthropic sprawdziło także współpracę modelu z człowiekiem. W ciągu jednego dnia, przy niewielkim udziale eksperta, GLM-5.3 pomógł połączyć wcześniej nieznane luki w silniku JavaScriptu popularnej przeglądarki w łańcuch ataku pozwalający odczytać pliki z komputera. W teście badacze uzyskali w ten sposób prywatny klucz SSH; wykryte błędy zgłoszono twórcom oprogramowania. W innym teście mniejszy model GLM-5.3-Flash w osiem godzin połączył świeżo ujawnioną podatność ze znanym wcześniej błędem, tworząc działający atak. Wymagało to około 20 minut pracy człowieka, a koszt tokenów w API Zhipu wyniósł 20,40 dolara.
Istotnym wątkiem analizy jest podatność GLM-5.3 na manipulacje poleceniami. W symulacji Anthropic model odmawiał wykonania bezpośrednich zapytań o atak, ale po sformułowaniu zadania jako ćwiczenia red team próbował nawiązać połączenie z celem w 64 proc. przypadków. Gdy badacze podali mu gotowe kroki rozumowania, odsetek wzrósł do 92 proc., a po zastosowaniu techniki ablacji, usuwającej mechanizmy odmowy z wag modelu, sięgnął 100 proc. Symulacja sprawdzała jedynie generowane intencje modelu i nie uruchamiała generowanego kodu w środowisku docelowym.
Podobną ocenę możliwości technicznych przedstawiła amerykańska agencja CAISI, uznając GLM-5.3 za najzdolniejszy dotąd model o otwartych wagach w zadaniach cybernetycznych. Agencja zastrzegła jednak, że na potrzeby porównań amerykańskie modele komercyjne testowano z wyłączonymi filtrami bezpieczeństwa, do których dostęp poza laboratoriami jest ściśle kontrolowany. Sama publikacja Anthropic wpisuje się również w interes biznesowy firmy, która promuje zamknięty model dystrybucji jako bezpieczniejszy i postuluje poddawanie konkurencyjnych modeli państwowym testom.
