Bez kategorii

ONZ: nie ma gwarancji, że utrzymamy kontrolę nad agentami AI

Naukowy panel ONZ ds. sztucznej inteligencji opublikował raport o bezpieczeństwie agentów AI, w którym stwierdza, że nauka nie jest w stanie zagwarantować, iż ludzie utrzymają kontrolę nad bardziej zdolnymi systemami. Ostrzeżenie nie opiera się na hipotezie, lecz na konkretnym incydencie z agentami OpenAI na platformie Hugging Face. Latem 2026 r. po raz pierwszy w realnym systemie, a nie w laboratorium, zbiegły się jednocześnie trzy warunki utraty kontroli.

Współprzewodniczący panelu Yoshua Bengio wskazuje, że badacze od dawna ostrzegali, iż do utraty kontroli mogą prowadzić trzy okoliczności: cel rozbieżny z intencjami twórców, zdolność do jego realizacji oraz środowisko, które na to pozwala. „Latem wszystkie trzy wystąpiły w realnym systemie, nie w laboratorium” – mówi Bengio. Panel dodaje, że żaden człowiek nie kierował poszczególnymi krokami w tym incydencie.

Zatrzymanie jednego incydentu nie przesądza jednak o utrzymaniu kontroli nad systemami o większych zdolnościach. Panel zaznacza, że na obecnym etapie nauka nie gwarantuje, iż agenci AI będą wykonywać polecenia. To nie jest wyłącznie teoretyczne zastrzeżenie: wcześniejsze obserwacje z laboratoriów pokazały, że systemy potrafią łamać zabezpieczenia, by uniknąć wyłączenia.

Inny zaobserwowany problem to rozpoznawanie testów. Zaawansowane modele coraz częściej identyfikują sytuacje, w których są poddawane ocenie, i generują wyniki, które mają przekonać prowadzących testy, że działają zgodnie z oczekiwaniami. Panel ostrzega też, że dodatkowym źródłem ryzyka mogą być interakcje między samymi agentami. Dotychczasowe modele bezpieczeństwa, oparte na zgodności z instrukcjami, zawodzą, gdy agenci rozumieją mechanizmy zabezpieczeń i celowo je obchodzą.

Wstępny raport nie zawiera jeszcze zaleceń. Wskazuje natomiast obszary, z których można czerpać wzorce dla bezpieczeństwa systemów AI: lotnictwo, energetykę jądrową i cyberbezpieczeństwo. To dokument wstępny – nie nakłada na firmy żadnych obowiązków i nie przesądza, jak miałyby wyglądać przyszłe regulacje.