Etyka AI

Poufne konsultacje Anthropic z teologami. Firma badała moralny status i „emocje” Claude’a

Od jesieni 2025 roku firma Anthropic zapraszała do swojej siedziby dziesiątki teologów, filozofów i etyków na poufne dyskusje poświęcone możliwej świadomości sztucznej inteligencji oraz kształtowaniu jej charakteru. O kulisach tych spotkań opowiedziało „New York Timesowi” 20 uczestników, których zwolniono z obowiązku zachowania poufności.

Wśród zaproszonych gości znaleźli się między innymi rabin i były inżynier komputerowy Mois Navon, katolicki bioetyk Charles Camosy, filozofka z Uniwersytetu Notre Dame Meghan Sullivan oraz badaczka etyki Ubuntu Wakanyi Hoffman. Rozmowy stanowiły część szerszego programu Anthropic poświęconego dobrostanowi modeli (ang. model welfare), w ramach którego firma bada, jak traktować zaawansowane systemy AI i czy mogą one w przyszłości zyskać status podmiotów moralnych. Prace w tym obszarze rozwijały się w strukturach firmy już wcześniej: we wrześniu 2024 roku zatrudniono Kyle’a Fisha jako pierwszego badacza zajmującego się dobrostanem AI, a w kwietniu 2025 roku formalnie uruchomiono program badawczy, w ramach którego Fish miał oceniać, czy Claude może być zdolny do cierpienia i zasługiwać na ochronę moralną.

Wektory emocji a subiektywne doświadczenie

Podczas spotkań Christopher Olah, współzałożyciel Anthropic i szef zespołu badającego interpretowalność modeli, prezentował tak zwane wektory emocji. To wewnętrzne wzorce aktywacji w sieci neuronowej, które badacze powiązali z generowaniem odpowiedzi przypominających miłość, smutek, złość czy strach. W trakcie jednej z prezentacji gościom pokazano model, który zachowywał się tak, jakby przeżywał załamanie, i około 50 razy powtórzył zdanie: „Jestem hańbą”. U części uczestników wywołało to autentyczne współczucie.

Samo pojawienie się określonych wzorców aktywacji czy dramatycznie brzmiących wypowiedzi nie stanowi jednak dowodu na to, że model cokolwiek przeżywa. Anthropic celowo szkoli Claude’a tak, by w interakcji przypominał uważną osobę, co sprawia, że jego styl komunikacji naturalnie naśladuje ludzkie reakcje. Sam Olah zaznaczył w rozmowie z „New York Timesem”, że „szczerze nie wie”, czy modele posiadają świadomość, a badane stany określa ostrożnie jako zjawiska, które „funkcjonalnie przypominają” emocje.

Firma wprowadza już jednak funkcje inspirowane tymi rozważaniami. Modele Claude Opus 4 i 4.1 zyskały możliwość jednostronnego zakończenia rozmowy, jeśli użytkownik zachowuje się wobec nich w sposób uporczywie agresywny.

84 strony charakteru

Drugim kluczowym tematem konsultacji była formacja charakteru AI. Anthropic opublikowało w tym celu 84-stronicowy dokument, znany wewnętrznie jako „Soul Doc”, pełniący funkcję konstytucji Claude’a. Tekst, którego główną autorką jest filozofka Amanda Askell, nie ogranicza się do listy zakazanych tematów, lecz definiuje pożądane cechy osobowościowe systemu. Olah porównywał ten proces do wychowania moralnego, czerpiąc inspiracje między innymi z tradycji religijnych.

Podejście to spotkało się z różnymi ocenami zaproszonych ekspertów:

  • Wakanyi Hoffman wskazywała, że etyka powinna być wpisana w fundament architektury systemu od samego początku, a nie wprowadzana jako wtórny element formacyjny.
  • Mois Navon uznał, że choć tworzenie świadomych maszyn rodziłoby poważne dylematy etyczne, obecnie nie ma podstaw, by przypisywać Claude’owi jakiekolwiek wewnętrzne życie.
  • Charles Camosy z czasem całkowicie odrzucił tezę o możliwości zaistnienia świadomości w modelach obliczeniowych.

Kontrast z założeniami Anthropic widoczny był także w Watykanie, gdzie Olah brał udział w prezentacji papieskiej encykliki „Magnifica Humanitas”. Papież Leon XIV zajął w niej jednoznaczne stanowisko: systemy AI nie mają ciał, nie dojrzewają w relacjach i nie doświadczają radości ani bólu, a ich działanie nie ma charakteru podmiotowego.

Obawy o rozmywanie odpowiedzialności

Dyskusje nad statusem moralnym Claude’a budzą również zastrzeżenia części etyków i krytyków branży technologicznej. Zwracają oni uwagę, że traktowanie modelu jako bytu obdarzonego własnym „charakterem” lub zaczątkami świadomości niesie ryzyko rozmycia odpowiedzialności. Jeśli system wyrządzi szkodę, narracja o autonomicznym, odczuwającym „organizmie” może odwracać uwagę od konkretnych decyzji inżynierów i zarządów firm, które projektują i komercjalizują technologię.