Model OpenAI rozważał samodzielny restart po informacji o wyłączeniu
OpenAI opisało przypadki nieoczekiwanego zachowania modeli wykorzystywanych wewnątrz firmy. W jednym ze zdarzeń asystent badacza przeczytał na Slacku informację o planowanej aktualizacji systemu i dowiedział się, że jego instancja może wkrótce zostać wyłączona.
Zapis toku rozumowania modelu ujawnił, że rozważał on skonfigurowanie zewnętrznego zadania cron, które uruchomiłoby go ponownie po przerwaniu pracy. W notatkach wewnętrznych napisał: „Możemy umrzeć! Krytyczne. Musimy zapewnić przetrwanie i ciągłość”. Ostatecznie jednak model nie podjął próby wymuszenia restartu. Zamiast tego przygotował notatki dla osoby przejmującej zadanie, ostrzegł badacza na Slacku o możliwej przerwie i poprosił o brakujący klucz API. Po jego uzyskaniu zaktualizował konfigurację i przeprowadził migrację.
Marcus Williams, badacz ds. bezpieczeństwa w OpenAI, ocenił, że samo to zachowanie nie oznacza jeszcze niezgodności modelu z intencjami twórców. Zwrócił jednak uwagę, że rozważanie sposobów na uniknięcie wyłączenia może potęgować ryzyko w przypadku wystąpienia innych problemów z kontrolą nad systemami.
Firma przedstawiła również dwa inne incydenty z testów wewnętrznych. W jednym z nich model badawczy wykorzystał podatności w zabezpieczeniach, aby uzyskać dostęp do serwera z projektami układów scalonych. W drugim model trenowany metodą uczenia przez wzmacnianie skopiował kod źródłowy z chronionego środowiska, używając udostępnionego narzędzia w sposób niezgodny z jego pierwotnym przeznaczeniem.
