Geometria myślenia: naukowcy odkryli mapę operacji logicznych we wnętrzu modeli AI
Większość z nas traktuje odpowiedzi generowane przez AI jako czysty tekst, ale dla samej sieci neuronowej to ciąg precyzyjnych, geometrycznych operacji. Zespół z KAIST oraz Naver AI Lab zajrzał pod maskę popularnych modeli, takich jak Qwen i Gemma, by sprawdzić, czy mechanizm –łańcucha myśli– (Chain of Thought) jest jedynie retorycznym popisem, czy realnym procesem logicznym. Wyniki opublikowane w serwisie arXiv są jednoznaczne: każda operacja logiczna posiada własny, odrębny wzorzec aktywacji w przestrzeni numerycznej.
Dlaczego to ważne? Odkrycie to fundamentalnie zmienia podejście do interpretowalności i bezpieczeństwa AI. Skoro naukowcy potrafią teraz zidentyfikować specyficzne kroki, takie jak dekompozycja celu czy formułowanie problemu, możemy kontrolować przebieg wnioskowania bez polegania na tym, co model sam o sobie napisze. To klucz do wykrywania ukrytych błędów lub manipulacji na etapie ich powstawania, zanim trafią do użytkownika.
Architektura ukrytego rozumowania
Badacze zdefiniowali osiem kluczowych operacji, w tym dedukcję i przywoływanie formuł. Analizując wewnętrzne reprezentacje modeli podczas rozwiązywania zadań matematycznych, zauważyli, że sygnały te nie rozkładają się równomiernie. Największa separacja procesów następuje w środkowych warstwach sieci. To właśnie tam zachodzi najintensywniejsza obróbka logiczna.
Co ciekawe, to samo słowo – np. –zatem– lub –jest– – może wyglądać zupełnie inaczej w kodzie binarnym modelu. Naukowcy stwierdzili, że –identyczne tokeny są reprezentowane w różny sposób w zależności od operacji wykonywanej w otaczającym je fragmencie–. Oznacza to, że model doskonale –wie–, czy dany wyraz służy mu w danej chwili do czytania danych, czy jest zwieńczeniem skomplikowanego obliczenia.
Fundamenty logicznej spójności
Ciągłość myślenia maszynowego nie jest dziełem przypadku. Poprzez interwencję w mechanizm uwagi (attention) i zablokowanie dostępu do poprzednich 30 tokenów, badacze zaobserwowali drastyczne osłabienie sygnału operacyjnego. Jak zauważono w raporcie, –interwencje polegające na maskowaniu uwagi pokazują, że reprezentacje dopasowane do operacji zależą od poprzedniego kontekstu rozumowania–. Nawet gdy model popełnia błąd rachunkowy, jego wewnętrzny tryb pracy pozostaje –zdrowy– – błędne działanie wciąż ma geometrię procesu obliczeniowego, a nie przypadkowego bełkotu.
Bezpieczeństwo czarnych skrzynek
Choć eksperymenty dotyczyły matematyki, ich znaczenie dla bezpieczeństwa AI (AI Safety) jest ogromne. Obecnie polegamy na analizie tekstu, ale modele potrafią maskować swoje prawdziwe ścieżki myślowe. Zrozumienie wewnętrznych wektorów pozwala zajrzeć tam, gdzie AI nie chce nas wpuścić. W dobie autonomicznych systemów zdolność do interpretacji tych procesów staje się niezbędnym bezpiecznikiem, pozwalającym upewnić się, że maszyna rzeczywiście myśli, a nie tylko udaje.
