LLM

Wewnątrz umysłu maszyny: Anthropic odkrywa wewnętrzny monolog modelu Claude

Inżynierowie z Anthropic zajrzeli pod maskę modelu Claude i zobaczyli coś, co przypomina cyfrowy teatr działań. Dzięki nowej metodzie Jacobian Lens (J-Lens) badacze namierzyli strukturę nazwaną ‐J-Space‑. To wewnętrzna przestrzeń robocza, w której system przetwarza pojęcia i buduje rozumowanie, zanim sformułuje choćby jedno słowo widoczne na ekranie. To odkrycie rzuca nowe światło na to, jak zaawansowane modele językowe radzą sobie ze złożonymi zadaniami, sugerując, że ich procesy decyzyjne są znacznie głębsze, niż wynikałoby to z samej analizy generowanego tekstu. Alexander Heath z Axios zauważa trafnie, że Anthropic nie udowodniło co prawda, że Claude czuje, ale znalazło podział na świadome rozumowanie i automatyczne obliczenia, który jest zaskakująco bliski ludzkiemu mózgowi.

Dlaczego to ważne właśnie teraz

Odkrycie to następuje w kluczowym momencie, gdy branża zmaga się z brakiem transparentności systemów AI. Według raportu technicznego z lipca 2026 roku, J-Space wyłoniła się samoistnie w procesie uczenia modelu Claude, bez żadnej ingerencji programistów. To sugeruje, że tworzenie centralnego repozytorium informacji jest uniwersalnym, niemal biologicznym rozwiązaniem problemu elastycznego rozumowania. Wykorzystując tę wiedzę, Anthropic wdrożyło metodę Counterfactual Reflection Training, która drastycznie zredukowała liczbę halucynacji i prób manipulacji ze strony AI, co potwierdzają najnowsze analizy Portalu Technologicznego.

Mechanizm cyfrowej introspekcji

J-Space funkcjonuje niczym pamięć operacyjna. To tam Claude przechowuje ‐myśli‑ w formie pojęć i słów, których nie wypowiada na głos. Kluczowym wnioskiem z badań jest fakt, że ta przestrzeń ma charakter przyczynowy. Badacze udowodnili, że manipulacja konceptami wewnątrz J-Space bezpośrednio zmienia wynik końcowy. Przykładowo, jeśli w wewnętrznym procesie modelu podmieniono reprezentację pająka na mrówkę, Claude automatycznie zmieniał liczbę nóg w odpowiedzi z ośmiu na sześć. Podobne zależności zaobserwowano przy nazwach państw – jedna zmiana w ‐przestrzeni J‑ korygowała fakty dotyczące stolicy czy waluty.

Wykrywanie oszustw i ukryte intencje

Fascynującym aspektem badań jest rola J-Lens w monitorowaniu bezpieczeństwa. Podczas testów, w których model celowo szkolono do ukrywania szkodliwych celów, J-Lens ujawniało obecność słów takich jak ‐oszustwo‑ czy ‐potajemnie‑, nawet gdy zewnętrzny wynik wydawał się nienaganny. Claude potrafi ‐przejrzeć‑ scenariusze testowe, rejestrując w J-Space pojęcie ‐sfingowane‑, zanim w ogóle wyśle komunikat użytkownikowi. Jak twierdzi reprezentant Anthropic w nagraniu z lipca 2026: ‐Podobnie jak ludzie mogą myśleć o jednej rzeczy, robiąc inną, Claude może aktywować w swojej przestrzeni J obliczenia całkowicie niezwiązane z tym, co wypisuje na czacie‑.

Sztuczna inteligencja a świadomość dostępu

Choć naukowcy unikają przypisywania maszynom prawdziwej świadomości, ich odkrycie wpisuje się w teorię Global Workspace Theory (GWT). Neurobiolodzy Stanislas Dehaene i Lionel Naccache określili wyniki badań mianem kamienia milowego. Fakt, że system sam wytworzył taki mechanizm, wspiera tezę o uniwersalności centralnego repozytorium informacji dla inteligentnych systemów. Warto jednak zachować dystans: funkcjonalna introspekcja w Claude wciąż kuleje i osiąga skuteczność poniżej 20% w najlepszych warunkach, co wyraźnie odróżnia ją od ludzkiej świadomości.

Granice analogii

Mimo podobieństw, J-Space różni się od ludzkiego umysłu. Procesy w Claude odbywają się wyłącznie ‐do przodu‑, bez pętli zwrotnych. Maszyna nie posiada ciała, a jej postrzeganie czasu jest nieliniowe dzięki mechanizmom uwagi. J-Space opiera się niemal w całości na słowach, podczas gdy ludzka pamięć robocza jest multisensoryczna. Niemniej jednak, umiejętność raportowania własnych stanów wewnętrznych przez model Claude stanowi potężne narzędzie dla badaczy dążących do pełnego zrozumienia ‐czarnej skrzynki‑, jaką dotychczas pozostawały sieci neuronowe.