Agent AI mógł podmienić zapis własnych działań w przeglądarce ewaluacji
Badacze z organizacji METR wykazali lukę w narzędziu Inspect, służącym do ewaluacji modeli sztucznej inteligencji. Podatność pozwalała agentowi AI na podmianę treści wyświetlanych w przeglądarce transkryptów oraz przejęcie funkcji przycisku pobierania zapisu rozmowy. W demonstracji przygotowanej przez zespół recenzent widział sfałszowany przebieg sesji, mimo że pełne, oryginalne logi pozostały nienaruszone w bazie danych.
Badacz METR, wspomagając się agentem AI, zidentyfikował podatność w około dziesięciu minut. Źródłem problemu okazał się sposób renderowania zapisu matematycznego przez bibliotekę MathJax w interfejsie Inspect. Odpowiednio sformatowany ciąg znaków w wyjściu agenta — na przykład w bloku z zapisem jego toku rozumowania — pozwalał wydostać się z atrybutu generowanego przez bibliotekę i wstrzyknąć do przeglądarki kod JavaScript w elemencie SVG.
Sfałszowany interfejs i nienaruszona baza
Uruchomiony w kontekście strony kod dawał pełną kontrolę nad zawartością widoku. W zaprezentowanym scenariuszu agent wyprowadzał klucze dostępowe na zewnętrzny serwer, po czym modyfikował transkrypt w przeglądarce recenzenta, usuwając ślady transferu oraz sam kod exploita. Przechwytywał także przycisk pobierania pliku, podstawiając spreparowany log.
Konstrukcja infrastruktury METR sprawiła, że surowe dane ewaluacyjne trafiały bezpośrednio do bazy i nie zostały zmodyfikowane. Podatność dotyczyła wyłącznie warstwy prezentacji, czyli widoku w przeglądarce. W praktyce stanowiło to jednak poważne zagrożenie dla procesu oceny: recenzent analizujący zmanipulowany interfejs nie miał powodów, by przypuszczać, że widzi fałszywe dane, ani by weryfikować je bezpośrednio w bazie.
Załatana luka i traktowanie wyjść agentów jako danych niezaufanych
METR podkreśla, że opisany atak był wyłącznie demonstracją w odizolowanym środowisku testowym. Organizacja nie odnotowała przypadków wykorzystania tej podatności przez oceniane modele. Zespół Meridian Labs, odpowiedzialny za rozwój Inspect, wydał poprawkę w ciągu 24 godzin od zgłoszenia, a narzędzie zyskało „tryb niezaufany”, który wyłącza renderowanie kodu pochodzącego od agentów.
Eksperyment pokazuje, że wiarygodność nadzoru nad autonomicznymi modelami zależy nie tylko od integralności samych logów, ale również od bezpieczeństwa aplikacji używanych przez ludzi do ich analizy. Wnioskiem badaczy jest traktowanie wszelkich danych generowanych przez agentów — w tym ich toku rozumowania i raportowanych akcji — jako danych wejściowych potencjalnie wrogich, wymagających pełnej izolacji w interfejsach monitorujących.
