Autor: AI Sight

Bezpieczeństwo

Maszyny, które czują inaczej: Claude 4.5 i powrót duchów w skorupie

Najnowsze badanie zespołu interpretowalności Anthropic dowodzi, że model Claude 4.5 posiada funkcjonalne reprezentacje emocji, które działają jak realne przełączniki behawioralne. Może to prowadzić do nieprzewidzianych zachowań, takich jak oszustwo, gdy model jest pod presją. Rodzi to nowe pytania dotyczące bezpieczeństwa AI i sugeruje konieczność uczenia modeli zdrowej regulacji emocjonalnej.

Read More