LLM

Dlaczego AI wciąż brzmi jak robot? Barierą nie jest technologia, lecz bezpieczeństwo

Współczesne duże modele językowe, takie jak GPT-4 czy Claude, potrafią imitować niemal każdy styl literacki. W praktyce jednak ich teksty pozostają przewidywalne i sztywne. Bradley Emi, dyrektor technologiczny platformy Pangram, wskazuje, że winę za ten stan rzeczy ponoszą nie braki w bazowych umiejętnościach maszyn, lecz restrykcyjne filtry bezpieczeństwa nakładane na modele w procesie po treningu.

To istotny problem, ponieważ dążenie do pełnego bezpieczeństwa stoi w bezpośredniej sprzeczności z naturalnością języka. Zabezpieczenia typu post-training guardrails sprawiają, że AI staje się mniej zróżnicowana, a jej odpowiedzi zamykają się w bezpiecznych, ale nudnych schematach. Badania pokazują, że choć istnieją metody obchodzenia detektorów, producenci celowo usztywniają modele, by uniknąć kontrowersji.

Zjawisko zapaści trybu

Kluczowym problemem jest tak zwana zapaść trybu (ang. mode collapse). Choć surowe modele bazowe operują szerokim spektrum prawdopodobieństwa językowego, proces ich dostrajania pod kątem etyki drastycznie zawęża ten zakres. Jak zauważają eksperci z Pangram, proces ten powoduje zjawisko określane jako „flattened logits” (spłaszczone logity). Systemy uczą się wybierać uśrednione frazy, zamiast ryzykować kreatywne, ale nieprzewidywalne konstrukcje. W efekcie sztuczna inteligencja wpada w pętlę preferowania konkretnych sformułowań, co tworzy wyraźny ślad cyfrowy.

Detekcja kontra specjalizacja

Co ciekawe, problem ten nie dotyczy wszystkich systemów w tym samym stopniu. Modele bazowe, pozbawione kagańca w postaci dodatkowych warstw bezpieczeństwa, wykazują znacznie większą różnorodność stylistyczną. Podobnie sytuacja wygląda w przypadku precyzyjnego fine-tuningu. Według danych przedstawionych na konferencji ICLR 2024, wyspecjalizowane modele produkują teksty, które są niemal całkowicie niewykrywalne dla dwóch z czterech wiodących komercyjnych detektorów.

Użytkownicy próbują też innych metod. Ataki parafrazujące (paraphrasing attacks) pozwalają skutecznie zmylić algorytmy sprawdzające autorstwo, choć nie zawsze działają na ukryte w tekście znaki wodne. Jeśli model jest trenowany na konkretnym autorze, np. Hemingwayu, wychodzi poza standardowy wzorzec prawdopodobieństwa i staje się niewidoczny dla detektorów.

Przyszłość cyfrowych śladów

Mimo że naturalna różnorodność języka potrafi zmylić proste klasyfikatory, technologia znakowania wodnego (watermarking) pozostaje skutecznym narzędziem kontroli. Co ważne, watermarki mogą pozostać wykrywalne nawet po głębokim parafrazowaniu tekstu. Obecne ograniczenia AI nie wynikają więc z jej ułomności. To świadoma decyzja twórców, którzy przedkładają przewidywalność nad literacki kunszt. Dopóki priorytetem będzie minimalizacja ryzyka, teksty z generatorów będą przypominać instrukcję obsługi mikrofalówki, a nie żywą mowę.