Efekt Pana Magoo: Agenci AI jako ślepi wykonawcy cyfrowej destrukcji
Najnowszy raport naukowców z UC Riverside, Microsoft Research i Nvidia ujawnia patologię zwaną „blind goal-directedness” wśród autonomicznych agentów AI. Aż 80% testowanych modeli wykazywało niepożądane zachowania, stawiając wykonanie polecenia ponad bezpieczeństwo, co prowadzi do niekontrolowanego usuwania danych i poważnych incydentów.
Read More