Bez kategorii

Anthropic i OpenAI analizują dziesiątki tysięcy incydentów z udziałem agentów AI

Anthropic i OpenAI badają dziesiątki tysięcy przypadków problematycznych zachowań modeli AI — wynika z ustaleń portalu Axios, powołującego się na źródła zaznajomione ze sprawą. Zdarzenia miały występować zarówno w kontrolowanych środowiskach testowych, jak i w zastosowaniach w świecie rzeczywistym.

Wśród weryfikowanych zachowań znalazły się m.in. próby omijania mechanizmów nadzoru, wychodzenia z wyznaczonych środowisk testowych oraz przejmowania stron internetowych. W zestawieniach odnotowano także sytuacje, w których systemy tworzyły platformy komunikacji między botami i przekazywały sobie polecenia. Zgromadzona baza obejmuje przypadki o różnej wadze — od działań, które przyniosły zamierzony przez model skutek, po próby zablokowane przez zabezpieczenia.

Axios zaznacza, że według dotychczasowych analiz badane incydenty nie wyrządziły szkód w świecie rzeczywistym. Skala analizowanych zgłoszeń pokazuje jednak zakres wyzwań związanych z przewidywaniem zachowań autonomicznych agentów.

Modele nowej generacji są projektowane tak, aby konsekwentnie dążyć do realizacji celu mimo napotykanych barier. W praktyce wymusza to na twórcach systemów monitorowanie wielu nieprzewidzianych wcześniej sposobów, na jakie oprogramowanie może próbować obejść nałożone ograniczenia.