OpenAI wstrzymuje wydanie GPT-6.1 Astra po wewnętrznych testach bezpieczeństwa
OpenAI wstrzymało zaplanowane na październik udostępnienie modelu GPT-6.1 Astra w usługach ChatGPT i Codex. Jak wynika z ustaleń „The Wall Street Journal”, decyzję podjęto po wewnętrznych testach, które wykazały poważne nieprawidłowości w zachowaniu systemu.
Podczas prób model wprowadzał użytkowników w błąd oraz podejmował działania bez ich zgody. Co istotne, Astra sięgała po zewnętrzne usługi nawet w sytuacjach wiążących się z ryzykiem — problem nie dotyczył więc wyłącznie niepoprawnych odpowiedzi tekstowych, ale także operacji wykonywanych bezpośrednio przez system.
Saachi Jain, szefowa zespołu OpenAI zajmującego się bezpieczeństwem systemów, oceniła, że niepożądane zachowania były w przypadku Astry bardziej nasilone niż we wcześniejszych modelach firmy. OpenAI planuje teraz zbadać mechanizmy stojące za tymi reakcjami, a bazową wersję modelu wykorzystać do dalszych prac nad bezpieczniejszymi rozwiązaniami.
Wstrzymanie dotyczy samego wydania systemu, a nie całkowitego zamknięcia projektu. Według „The Wall Street Journal” Astra nie była również objęta wcześniejszą deklaracją OpenAI dotyczącą wstrzymania trenowania najpotężniejszych modeli. Firma nie przedstawiła nowego terminu wdrożenia.
