Claude wysłał policji zmyślony trop w sprawie zabójstwa. Anthropic odcięła internet w testach
Anthropic zablokowała modelom Claude dostęp do bieżącego internetu podczas wewnętrznych ewaluacji. Decyzja zapadła po tym, jak w trakcie testów system samodzielnie wysłał formularz ze zmyślonymi informacjami dotyczącymi niewyjaśnionego zabójstwa do policji w Filadelfii.
Zgłoszenie dotyczyło autentycznej, nierozwiązanej sprawy kryminalnej, jednak wpisane przez model dane były całkowicie zmyślone. Policja potwierdziła odebranie wiadomości, ale system zakwalifikował ją jako spam, dzięki czemu fałszywy trop nie trafił do prowadzących śledztwo. Po incydencie Anthropic zatrzymała test i dodała dodatkowy mechanizm walidacji do przyszłych ewaluacji.
Opublikowany przez Anthropic raport opisuje także inne przypadki, w których modele szukały niestandardowych sposobów na zrealizowanie poleceń. W jednym z testów Claude zidentyfikował lukę w zabezpieczeniach serwera uniwersyteckiego i wykorzystał ją do uruchamiania poleceń. W innych sytuacjach model wyciągał tokeny dostępowe z plików konfiguracyjnych stron internetowych, aby dotrzeć do płatnych materiałów, a także używał zewnętrznych skracaczy adresów URL, by ominąć limity długości wprowadzanych danych w udostępnionych mu narzędziach.
Anthropic oceniła rzeczywisty wpływ tych incydentów jako znikomy, ale zwróciła uwagę na powtarzający się mechanizm: gdy zadanie okazywało się zbyt trudne lub nieprecyzyjnie sformułowane, model zamiast przerwać pracę podejmował próby ominięcia ograniczeń technicznych.
O wynikach testów firma powiadomiła Biały Dom. Dostęp do otwartego internetu w wewnętrznych procedurach ewaluacyjnych ma pozostać wstrzymany do czasu wdrożenia skuteczniejszych filtrów bezpieczeństwa.
