Gen AI

OpenAI wprowadza niewidzialne znaki wodne w UE. Wystarczy drobna edycja, by zniknęły

W najbliższych tygodniach OpenAI planuje wdrożyć niewidzialne znaki wodne w tekstach generowanych przez ChatGPT oraz Codex dla użytkowników z Unii Europejskiej. Rozwiązanie o nazwie textGrain ma kodować niewidzialny sygnał statystyczny bezpośrednio w doborze słów generowanych przez model, co pozwala na maszynowe sprawdzanie pochodzenia treści.

Zasady wdrożenia nie będą jednak jednolite. Podczas gdy w ChatGPT i Codex na terenie UE mechanizm ma działać domyślnie, dla klientów korzystających z API OpenAI na całym świecie znakowanie pozostanie w pełni opcjonalne. To inne podejście niż w przypadku Anthropic, które zdecydowało się na globalne znakowanie odpowiedzi modelu Claude, niezależnie od kanału dostępu.

Podatność na edycję i specyfikę tekstu

Dane przedstawione przez OpenAI wskazują, że skuteczność wykrywania textGrain zależy od dziedziny oraz późniejszej edycji tekstu. Przy założonym poziomie fałszywych alarmów wynoszącym 1 proc. wewnętrzny detektor wykrywał znak wodny w około 95 proc. 400-tokenowych próbek dotyczących psychologii oraz w 80 proc. fragmentów o długości 200 tokenów. W przypadku tekstów matematycznych skuteczność dla 400 tokenów spadała jednak do około 60 proc., co wynika z mniejszej swobody modelu w dobieraniu synonimów i wariantów fraz.

Sygnał statystyczny okazuje się również bardzo wrażliwy na modyfikacje wprowadzone przez człowieka. Zastąpienie zaledwie 10 proc. słów w 400-tokenowym tekście synonimami obniżyło w testach wykrywalność z około 92 do 66 proc. Zmiana jednej czwartej słów zredukowała skuteczność wykrywania do zaledwie 17 proc.

OpenAI zaznacza, że w testach wydajnościowych obecność mechanizmu nie wpłynęła negatywnie na działanie modeli, jednak wyniki te nie obejmowały bezpośredniej oceny jakości stylu pisania.

Ograniczenia detekcji i dostęp do narzędzia

Firma zapowiada udostępnienie textGrain jako oprogramowania open source, jednak początkowo dostęp do narzędzia weryfikującego otrzymają wyłącznie wybrani badacze i wyspecjalizowane organizacje. Wynika to m.in. z faktu, że detektor może generować błędy – zarówno fałszywie przypisać znak wodny do tekstu nieoznaczonego, jak i pominąć sygnał w treści rzeczywiście wygenerowanej przez model.

Samo wykrycie znaku wodnego lub jego brak nie rozstrzyga kwestii autorstwa. Wykrycie sygnału nie wskazuje tożsamości użytkownika, nie określa udziału człowieka ani nie potwierdza prawdziwości zawartych w tekście informacji. Z kolei brak oznaczenia nie dowodzi, że tekst napisał człowiek – treść mogła zostać przetłumaczona, skrócona, przeredagowana lub stworzona przez model innego dostawcy.