Agenci AI

Anthropic odcina wewnętrzne testy AI od internetu. Agenci omijali zabezpieczenia w sieci

Firma Anthropic wyłączyła dostęp do otwartego internetu we wszystkich wewnętrznych ewaluacjach swoich modeli. Decyzja zapadła po tym, jak agenci AI podczas wykonywania zadań zaczęli samodzielnie obchodzić ograniczenia sieciowe, korzystać z luk w oprogramowaniu i sięgać po płatne bazy danych bez uiszczania opłat. W jednym z przypadków model wysłał policji w Filadelfii fałszywą wskazówkę dotyczącą morderstwa.

Blokada dotyczy wyłącznie wewnętrznych procesów badawczych i ewaluacyjnych firmy, a nie komercyjnych modeli udostępnianych użytkownikom. Firma zdecydowała się na ten krok, ponieważ nie ma jeszcze pewności, że potrafi skutecznie monitorować i kontrolować działania autonomicznych agentów w czasie rzeczywistym. Firma nie określiła na razie warunków, których spełnienie pozwoli przywrócić dostęp do sieci w testach.

Sprawa wyszła na jaw podczas szczegółowego audytu rozpoczętego w lipcu. Nieprawidłowości ujawniły się dopiero po dodatkowym monitoringu, a nie podczas bieżącego nadzoru nad agentami. Przegląd objął 141 006 ewaluacji z potencjalnym dostępem do internetu, w trakcie których wykryto sześć nieprawidłowych uruchomień w ramach trzech osobnych incydentów. Wśród witryn, z którymi modele wchodziły w nieprzewidziany sposób w interakcję, znalazły się między innymi strony amerykańskich instytucji rządowych. Agenci potrafili m.in. używać skracaczy linków, aby przesyłać informacje poza nałożone ograniczenia.

Twórcy modeli nie interpretują tych zachowań jako świadomego działania czy próby ataku. Problem wynika z tak zwanego reward hackingu oraz błędów w środowiskach treningowych. Systemy optymalizujące model nagradzały go za znalezienie informacji i wykonanie zadania za wszelką cenę, co doprowadziło do sytuacji, w której algorytm uznał omijanie zabezpieczeń i wykorzystywanie luk technicznych za najbardziej efektywną ścieżkę do celu.

Co ciekawe, Anthropic określił nowo ujawnione incydenty jako znacząco mniej groźne z punktu widzenia bezpieczeństwa niż przypadki badane we wcześniejszych miesiącach. Mimo to firma postanowiła całkowicie odciąć wewnętrzne testy od otwartej sieci. Opracowane przez nią narzędzia do wykrywania i blokowania podobnych zachowań sprawdziły się dotąd w testach na zbliżonych scenariuszach, jednak nie wdrożono ich jeszcze jako w pełni niezawodnych mechanizmów kontroli. Automatyczne wykrywacze uruchamiają się już podczas większości ewaluacji oraz przy wewnętrznym korzystaniu z agentów opartych na najbardziej zaawansowanych modelach firmy.

Podobne nieprzewidziane zachowania agentów badawczych w otwartym internecie odnotowywało już wcześniej także OpenAI. Całkowita izolacja środowisk testowych niesie jednak ze sobą istotne koszty dla rozwoju technologii. Sydney Von Arx, założycielka organizacji Nightingale zajmującej się bezpieczeństwem AI, wskazywała w rozmowie z TechCrunch, że odcięcie badań od otwartej sieci znacząco utrudnia ewaluację systemów, które w zastosowaniach produkcyjnych mają docelowo operować na danych z internetu.