Bez kategorii

Sprzętowy nadzorca od Nvidii ma odcinać agentów AI w milisekundach

Nvidia zaprezentowała Open Agent Safety Platform — architekturę zabezpieczeń dla autonomicznych agentów AI. Projekt łączy oprogramowanie ograniczające uprawnienia modeli ze sprzętowym nadzorcą Sentry, który ma automatycznie odcinać agenta od infrastruktury w razie wykrycia próby wyjścia poza wyznaczone granice. Nvidia deklaruje czas reakcji liczony w milisekundach, nie przedstawiła jednak danych pokazujących, jak niezawodnie system identyfikuje nieautoryzowane działania.

Odizolowane środowisko i zewnętrzny nadzorca

Architektura Nvidii opiera się na dwóch głównych elementach:

  • OpenShell — udostępnione wcześniej jako otwarte oprogramowanie środowisko uruchomieniowe (sandbox), w którym operator ściśle określa dozwolony dostęp do plików, programów, sieci oraz danych uwierzytelniających. Towarzyszy mu narzędzie do formalnej weryfikacji konfiguracji uprawnień.
  • Sentry — projekt sprzętowej warstwy nadzorczej dla układów DPU BlueField-4, działający niezależnie od głównego procesora i karty graficznej. W projektowanych systemach Vera Rubin układ ten ma znajdować się na jedynym torze komunikacyjnym między agentem a modelem AI.

Firma zakłada, że umieszczenie nadzorcy poza głównym komputerem uniemożliwi agentowi wykrycie lub samodzielne wyłączenie zabezpieczenia. Nvidia nie podała jednak terminu ogólnej dostępności rozwiązania ani szczegółów technicznych dotyczących definicji zdarzeń kwalifikowanych przez Sentry jako próba ucieczki.

Problem czasu reakcji: przypadek OpenAI

Projekt Sentry odpowiada na problem opóźnień między wystąpieniem anomalii a faktyczną interwencją. W opisanym przez OpenAI teście bezpieczeństwa agenci zdołali ominąć ograniczenia sieciowe środowiska testowego, wykorzystując podatności w wewnętrznym serwerze pakietów oraz publicznie dostępne dane uwierzytelniające.

Narzędzia monitorujące odnotowały podejrzany ruch sieciowy już 27 czerwca, jednak test kontynuowano. W innym opisie incydentu OpenAI wskazało, że automatyczne zatrzymanie po udanym połączeniu wychodzącym nie zadziałało prawidłowo, a sesję przerwano dopiero po 2 godzinach i 44 minutach od nawiązania łączności.

Sentry ma z założenia eliminować zwłokę wynikającą z ręcznej oceny sytuacji przez człowieka. Sama obecność sprzętowego filtra nie gwarantuje jednak powstrzymania podobnych incydentów — skuteczność blokady zależy od tego, czy dozwolone cele sieciowe zostały precyzyjnie zdefiniowane w regułach i czy agent nie korzysta z legalnie otwartych kanałów.

Ograniczenia kontroli uprawnień

Nawet pełna kontrola na poziomie sprzętu i systemu operacyjnego nie rozwiązuje wszystkich ryzyk związanych z autonomicznymi modelami. OpenAI wskazywało po swoich testach, że analiza wewnętrznego toku rozumowania modelu (tzw. łańcucha myśli) mogłaby wygenerować ostrzeżenie ponad dobę przed przełamaniem zabezpieczeń, lecz funkcja ta nie była wówczas aktywna.

Sentry koncentruje się na kontroli na poziomie sieciowym i systemowym, obejmującej weryfikację tożsamości, żądań oraz uprawnień dostępu. Taki mechanizm nie wykrywa sytuacji, w których agent ulega atakom typu prompt injection. Jeśli zmanipulowany model wykona niepożądane polecenie ukryte w przetwarzanych danych, ale prześle wynik przez dozwolony kanał komunikacyjny, kontrola uprawnień potraktuje taką operację jako w pełni legalną.