Exploit w trzy godziny. Jak model Claude Opus 5 pomógł przejąć konta pracowników OpenAI
Bezpieczeństwo oparte na wysokim progu wejścia właśnie przestało być skuteczną barierą. Zespół badawczy Hacktron, w którego skład weszli Harsh Jaiswal, Mohan Pedhapati oraz Rahul Maini, udowodnił, że wykorzystanie modelu językowego nowej generacji pozwala skrócić czas przygotowania zaawansowanego ataku z miesięcy do zaledwie kilkudziesięciu godzin. Celem testu stały się systemy OpenAI, a kluczowym narzędziem — model Claude Opus 5 od Anthropic.
Test, określony mianem „HEIF Heist”, udowodnił, że zaawansowane modele językowe mogą służyć jako akceleratory w procesie odkrywania i wykorzystywania luk bezpieczeństwa. Cały proces, od postawienia tezy do uzyskania dostępu do wewnętrznego repozytorium kodu OpenAI, zajął mniej niż 72 godziny i kosztował poniżej 3000 dolarów wydanych na dostęp do API. Badacze potwierdzili skuteczność ataku poprzez stworzenie nieinwazyjnego, testowego pull requestu w głównym monorepo firmy, deklarując jednocześnie, że nie przeglądali poufnych danych.
Automatyzacja tworzenia exploitów
Najistotniejszym elementem operacji była wydajność modelu Claude Opus 5 w generowaniu kodu złośliwego oprogramowania. Podczas gdy wcześniejsza wersja (Opus 4.8) nie radziła sobie z obejściem mechanizmów zabezpieczających pamięć (ASLR), nowy model potrzebował zaledwie trzech godzin na stworzenie działającego exploita. Uruchomiony jako autonomiczny agent w kontrolowanym środowisku, przejął serwer testowy w cztery godziny.
Badacze wykorzystali łańcuch dwóch krytycznych słabości:
- Luka w bibliotece libheif: Forum community.openai.com przetwarzało obrazy w formacie HEIC. Choć oficjalna poprawka bezpieczeństwa istniała od roku, pakiety Debiana używane przez serwer jej nie zawierały, co pozwoliło na zdalne wykonanie kodu (RCE).
- Miskonfiguracja SSO: Po przejęciu serwera forum badacze wykorzystali błąd w centralnym systemie logowania OpenAI. Pozwoliło to na podszycie się pod aktywnych użytkowników, w tym pracowników mających uprawnienia do usług takich jak ChatGPT i Codex.
Nowa rzeczywistość modelowania zagrożeń
Skuteczność testu „HEIF Heist” rzuca nowe światło na zarządzanie poprawkami i wykrywanie anomalii. Pomimo tysięcy prób i powtarzających się awarii procesów przetwarzania obrazu podczas testów, tylko jedna firma — Shopify — zareagowała na podejrzaną aktywność. OpenAI wyeliminowało błędy w ciągu 14 godzin od zgłoszenia, jednak przypadek ten pokazuje, że ataki wymagające niegdyś zasobów na poziomie państwowym są dziś dostępne dla małych zespołów dysponujących kartą kredytową. Co istotne, podczas gdy OpenAI zareagowało błyskawicznie, twórcy oprogramowania Discourse, na którym opierało się forum, zareagowali na zgłoszenie dopiero po kilku dniach.
To zdarzenie wymusza rewizję modeli zagrożeń. Skoro AI potrafi samodzielnie dostosować exploita do specyficznego środowiska serwerowego w kilka godzin, tradycyjne cykle aktualizacji oprogramowania i poleganie na złożoności systemów przestają wystarczać jako ochrona przed precyzyjnymi atakami.
