OpenAI zarzuca niektórym próby odtwarzania toku rozumowania modeli. Wskazuje powiązania z Moonshot AI
OpenAI poinformowało o przerwaniu skoordynowanej kampanii mającej na celu odtworzenie ukrytego toku rozumowania jego modeli. Firma wskazała, że za głównym skupiskiem tej aktywności stoją osoby powiązane z chińskim startupem Moonshot AI, twórcą chatbota Kimi. Zaznaczyła jednocześnie, że nie wie, czy wszyscy zaobserwowani operatorzy działali wspólnie lub na rzecz jednego podmiotu.
Według OpenAI próby rozpoczęły się 1 lipca. W kulminacyjnym momencie, 24 i 25 lipca, odnotowano 16 tys. żądań wysłanych przez ponad 4 tys. użytkowników, a całe monitorowane skupisko obejmowało ponad 15 tys. kont. Do 28 lipca firma miała całkowicie zablokować tę aktywność i załatać lukę.
Przedstawiciele OpenAI podkreślają, że podczas incydentu nie doszło do włamania do baz danych ani złamania zabezpieczeń kryptograficznych. Zamiast tego osoby biorące udział w operacji manipulowały interakcjami z modelami w taki sposób, aby zmusić je do ujawnienia chronionego procesu decyzyjnego w zwykłym tekście.
Nowsze modele potrafią analizować problem wieloetapowo, zanim wygenerują ostateczną odpowiedź. Ten wewnętrzny zapis rozumowania jest domyślnie ukrywany i szyfrowany. Według OpenAI jedną z wykorzystanych technik było przenoszenie zaszyfrowanego fragmentu rozumowania z jednej rozmowy do drugiej, a następnie nakłanianie modelu do zinterpretowania i ujawnienia jego treści.
Szczegółowy zapis rozumowania jest szczególnie wartościowy przy tak zwanej destylacji modeli — procesie trenowania mniejszego, tańszego systemu na wyjściach z bardziej zaawansowanego narzędzia. OpenAI uznaje nieautoryzowane pozyskiwanie tych danych za naruszenie swojego regulaminu, nazywając ten proceder „destylacją adwersarialną”.
Firma twierdzi, że zablokowała ścieżkę techniczną umożliwiającą manipulowanie cudzymi zaszyfrowanymi zapisami. Moonshot AI nie odniosło się do wpisu OpenAI.
