LLM

Chirurgia zamiast cenzury. Nous Research znalazło rzadki obwód odpowiedzialny za odmowy AI

Wystarczyło wyłączyć zaledwie 0,1% neuronów, aby Llama i Qwen przestały odmawiać wykonania poleceń i zrzuciły narzucony im podczas treningu gorset bezpieczeństwa. Zespół Nous Research zaprezentował metodę Contrastive Neuron Attribution (CNA), która udowadnia, że za blokady w modelach językowych odpowiadają precyzyjne, rzadkie obwody, a nie głębokie, semantyczne zrozumienie etyki. To odkrycie zmienia reguły gry w momencie, gdy rządy i firmy desperacko szukają metod na skuteczne sterowanie zachowaniem agentów AI w cyberprzestrzeni.

Dlaczego to ważne teraz? Metoda CNA wpisuje się w rynkowy pęd ku precyzyjnej kontroli nad LLM-ami — od zapobiegania jailbreakom po nowe wymogi compliance. W ostatnich tygodniach rośnie zainteresowanie technikami, które pozwalają „sterować bezpieczeństwem” na poziomie pojedynczych komórek sieci, zamiast polegać na nieprzewidywalnych filtrach językowych.

Precyzja chirurga zamiast młota

Modele typu instruct, jak Llama czy Qwen, mają wbudowane bezpieczniki. Do tej pory próby ich obejścia przypominały walenie w model młotem. Technika Contrastive Activation Addition (CAA) operowała na całych warstwach, co często kończyło się tym, że sztuczna inteligencja traciła rozum i generowała bełkot. Inna metoda — Sparse Autoencoders (SAEs) — wymaga z kolei potężnych zasobów do trenowania zewnętrznych struktur.

Badacze z Nous Research poszli inną drogą. Analizując różnice w aktywacji neuronów MLP przy szkodliwych i bezpiecznych promptach, wskazali konkretną „bramkę bezpieczeństwa”. W modelu Qwen 2.5 7B zidentyfikowanie i wyłączenie tych kilku punktów sprawiło, że wskaźnik odmów spadł z 87% do zaledwie 2%. Co najważniejsze, model nie zaczął przez to bełkotać i utrzymał niemal idealną spójność wypowiedzi.

Fundamenty ukryte w ostatniej warstwie

Zaskakuje fakt, że struktury odróżniające treści zakazane od dozwolonych istnieją w modelach bazowych jeszcze przed etapem alignmentu (dostrajania). Trening bezpieczeństwa nie buduje więc nowej logiki, a jedynie aktywuje filtr w już istniejących strukturach. CNA pokazało, że te „neurony odmowy” to w rzeczywistości mechanizm ostatecznej decyzji tuż przed wygenerowaniem słowa.

W przypadku Llama 3.2 1B aż 87% kluczowych neuronów odpowiedzialnych za blokadę znajduje się w trzech ostatnich warstwach. To dowód, że bezpieczeństwo w dzisiejszych modelach to proces doklejony na samym końcu, a nie głęboko zakorzeniona wartość.

Stabilność i liczby

Metoda CNA jest szybka i nie wymaga skomplikowanego douczania maszynowego. Naukowcy sprawdzili ją na 16 różnych modelach o rozmiarach od 1B do 72B parametrów. Wyniki są stałe: we wszystkich przypadkach udało się obniżyć liczbę odmów o ponad połowę przy zachowaniu stabilności pracy. Podczas gdy starsze metody drastycznie obniżały wydajność testu MMLU, CNA utrzymała jakość na poziomie powyżej 0.97. Pokazuje to, że przyszłość kontroli nad AI leży w precyzyjnej modyfikacji rzadkich obwodów, a nie w zmianach sygnału całych warstw sieci.