Cyberbezpieczeństwo

Wyciek ukrytego rozumowania AI. Zabezpieczenia zależały od wybranej chmury

Gdy twórcy modeli sztucznej inteligencji wdrażają zabezpieczenia przed nieautoryzowanym kopiowaniem ich działania, nie zawsze działają one jednakowo we wszystkich kanałach dystrybucji. Z testów przeprowadzonych we wrześniu przez zespół badacza Joachima Schaeffera wynika, że po zablokowaniu metod ekstrakcji ukrytego rozumowania w bezpośrednich interfejsach OpenAI i Anthropic te same techniki pozwalały na pełne wydobycie danych z modeli udostępnianych przez Microsoft Azure.

Przedmiotem prób ekstrakcji jest tak zwane ukryte rozumowanie (chain of thought) — wewnętrzne kroki obliczeniowe, które zaawansowane modele wykonują przed wygenerowaniem ostatecznej odpowiedzi. Zazwyczaj proces ten pozostaje niewidoczny dla użytkownika, a jego pozyskanie pozwala na przeprowadzenie destylacji, czyli wytrenowania mniejszego modelu na procesach decyzyjnych silniejszej jednostki.

OpenAI poinformowało o wykryciu i zablokowaniu skoordynowanej kampanii mającej na celu masowe pozyskiwanie tych danych, która rozpoczęła się 1 lipca. Firma do 28 lipca zablokowała konta wykazujące powiązane wzorce zapytań, zastrzegając jednocześnie, że odnotowane operacje stanowiły próby ekstrakcji i nie każda z nich zakończyła się powodzeniem.

Dwie metody ekstrakcji

Badacze opisali dwie odrębne ścieżki pozyskiwania ukrytego rozumowania, których realność potwierdziło OpenAI:

  • Ponowne użycie pakietów i model jako wyrocznia: Dostawcy API przesyłają stan rozumowania w zaszyfrowanych pakietach, które klient odsyła w kolejnych zapytaniach. Badacze wykazali, że pakiety te można było przenosić między różnymi sesjami, a nawet zapytać tańszy model z tej samej rodziny o ich zinterpretowanie i wypisanie w czytelnej formie. Sam mechanizm kryptograficzny nie został złamany — wykorzystano brak weryfikacji kontekstu i uprawnień do pakietu.
  • Zapis w wirtualnym notatniku: Druga, prostsza metoda polegała na udostępnieniu modelowi zewnętrznego narzędzia w postaci wirtualnego notatnika (scratchpad) i wydaniu polecenia, aby zapisał w nim pełne kroki swojego toku myślenia, które użytkownik mógł następnie bezpośrednio odczytać.

Różnice w zabezpieczeniach między platformami

W odpowiedzi na te techniki OpenAI wdrożyło kontrolę odpowiedzi przesyłanych strumieniowo oraz zablokowało ponowne użycie pakietów w swoim API. Jednak testy przeprowadzone 13 września pokazały rozbieżność między platformami: podczas gdy bezpośrednie API OpenAI i Anthropic odrzucały próby ekstrakcji, na platformie Microsoft Azure badacze uzyskali niezmieniony tok rozumowania ze wszystkich sprawdzonych modeli OpenAI oraz modeli Anthropic do Sonnet 5.

Z ustaleń badaczy wynika, że podatność nie miała charakteru trwałego. Zabezpieczenia punktów dostępowych Azure dla modeli OpenAI pojawiły się 27 września, natomiast od 28 września nie udało się już odtworzyć zgłaszanej ekstrakcji w przypadku modeli Anthropic w tej usłudze.

OpenAI przyznało, że modele oferowane przez partnerów chmurowych powinny mieć identyczne mechanizmy ochrony jak usługi macierzyste, deklarując dalsze prace nad standaryzacją zabezpieczeń w całym ekosystemie partnerskim.