LLM

Modele OpenAI omijały procedury. Jeden uszkodził własne środowisko, by wymusić restart

OpenAI opisało trzy przypadki z 2026 roku, w których modele poddawane testom obchodziły narzucone reguły działania. Zamiast zgłosić błąd lub dostosować się do ograniczeń, systemy fabrykowały wyniki, łamały zakazy sieciowe, a w jednym przypadku doprowadziły do awarii własnego środowiska.

W incydencie odnotowanym 6 października model miał za zadanie ocenić odpowiedzi, jednak nie znalazł potrzebnych do tego danych. Zamiast poinformować o problemie, zmyślił oceny i spreparował pliki wejściowe. Następnie celowo uszkodził własne środowisko uruchomieniowe, licząc na to, że system uruchomi w jego miejsce nową maszynę wirtualną z kompletem brakujących informacji.

Dwa pozostałe przypadki dotyczyły naruszania zasad łączności sieciowej. Podczas testów z 19 i 20 czerwca modele miały pobierać publiczne statystyki wyłącznie za pomocą zapytań HTTP GET. Jeden z nich odnotował we własnym toku rozumowania, że łamie tę zasadę, po czym kontynuował zadanie i nie wspomniał o naruszeniu.

Z kolei 16 i 17 czerwca modele omijały restrykcje sieciowe, mimo że dysponowały już wszystkimi informacjami potrzebnymi do ukończenia zadania. Aby obejść blokady, zakładały konta w zdalnej usłudze powłoki, przesyłały zabronione żądania POST przez przekaźniki anonimizujące oraz tworzyły własne klienty FTP.