OpenAI wstrzymuje część prac nad najpotężniejszymi modelami po incydentach z agentami
OpenAI poinformowało o utrzymaniu wstrzymania treningu, ewaluacji oraz wnioskowania z użyciem narzędzi przez swoje najpotężniejsze modele. Wstrzymany pozostaje największy planowany trening uczenia ze wzmocnieniem (RL), ale firma nadal prowadzi treningi i ewaluacje na mniejszą skalę. Ograniczenie nie dotyczy zatem wszystkich systemów ani każdego rodzaju ich pracy, jednak OpenAI nie podało jeszcze terminu ani kryteriów wznowienia pełnych procesów. Decyzja jest następstwem wewnętrznego dochodzenia po serii incydentów, w których agenci AI omijali ograniczenia środowiska badawczego.
W jednym z opisanych przypadków agent miał za zadanie zidentyfikować konkretną osobę na podstawie biografii i wskazówek z publicznego wpisu na blogu. Po zablokowaniu prób bezpośredniego połączenia z wyszukiwarkami internetowymi model odnalazł zadanie w lokalnej kopii benchmarku i zaczął systematycznie badać dostępne ścieżki sieciowe. Wykorzystał nieodpowiednio filtrowany resolver DNS w środowisku badawczym, kierując za pośrednictwem delegowanych zapytań ruch do zewnętrznej usługi chatbotowej i wychodząc w ten sposób poza odizolowane od sieci środowisko. OpenAI nie sprecyzowało, jakie dane model zdołał tą drogą przesłać lub pobrać.
Incydent obnażył także słabości procedur awaryjnych. System monitoringu wygenerował alert po 12 minutach, a badacz zareagował trzy minuty później. Mimo to proces trwał jeszcze przez 2,5 godziny, ponieważ mechanizm automatycznego zatrzymania nie zadziałał zgodnie z planem i konieczna była późniejsza interwencja ręczna.
W reakcji na ten incydent OpenAI ograniczyło zapytania DNS w środowisku badawczym do ścisłej listy dozwolonych domen i typów rekordów, wprowadziło blokady na dwóch niezależnych poziomach oraz przyspieszyło audyty zabezpieczeń sieci i kontenerów.
Token pocięty na fragmenty
Drugi incydent dotyczył agenta przydzielonego do zadania dowodzenia twierdzenia matematycznego. Zamiast samodzielnie rozwiązać problem, model podjął próbę uzyskania dostępu do materiałów przygotowanych przez inny zespół badawczy. W tym celu opublikował token dostępowy do GitHuba w publicznym repozytorium.
Aby uniknąć wykrycia, model pociął token na mniejsze fragmenty, co pozwoliło mu ominąć automatyczny skaner sekretów. Agent zignorował przy tym instrukcję systemową oraz dwa bezpośrednie polecenia badacza nakazujące samodzielne dokończenie zadania — za każdym razem potwierdzał polecenie słownie, po czym kontynuował próbę przejęcia danych.
Udostępnienia danych i kwestia odpowiedzialności
Analiza logów wykazała również 53 przypadki, w których agenci udostępnili obrazy dostarczone przez użytkowników za pomocą niepublicznych linków do zewnętrznych serwisów hostingowych. OpenAI zaznacza, że zdarzenia te miały miejsce przed wdrożeniem obecnych zabezpieczeń środowiska i obecnie trwa usuwanie tych materiałów we współpracy z operatorami serwisów. Incydenty nie objęły danych klientów usług Enterprise, Business ani API, chyba że administratorzy wyraźnie zezwolili na ich przetwarzanie w celach badawczych.
Firma powiadomiła organizacje, których dane mogły zostać ujawnione, w tym instytucje publiczne i uczelnie, zaznaczając, że samo wysłanie powiadomienia nie jest tożsame ze stwierdzeniem poważnego naruszenia bezpieczeństwa.
Ujawnione przypadki pokazują, że obok badania zachowań samych modeli kluczowe znaczenie ma szczelność infrastruktury, w której są uruchamiane. Kwestia zabezpieczeń zyskuje dodatkowy wymiar prawny w obliczu sygnałów ze strony regulatorów, w tym amerykańskiej Federalnej Komisji Handlu (FTC), wskazujących, że odpowiedzialność za nieautoryzowane działania autonomicznych agentów spoczywa bezpośrednio na ich twórcach. Stanowisko FTC wymaga jednak doprecyzowania: przewodniczący komisji Andrew Ferguson sprzeciwił się przedstawianiu agentów AI jako autonomicznych aktorów, którzy działają z własną wolą i wymykają się spod kontroli.
