Oceanus na horyzoncie: Anthropic testuje model Claude Mythos
Rywalizacja o dominację w sektorze sztucznej inteligencji wchodzi w nową, bardziej techniczną fazę. Jak wynika z ostatnich doniesień, Anthropic rozpoczął fazę red teamingu swojego najnowszego modelu o kryptonimie Oceanus. Nowy punkt kontrolny architektury Claude Mythos, oznaczony identyfikatorem claude-oceanus-v1-p, został dostrzeżony w konsoli deweloperskiej firmy, co sugeruje, że premiera rynkowa może nastąpić jeszcze w drugiej połowie czerwca.
To kluczowy moment, ponieważ rynek gwałtownie przesuwa się od prostych chatbotów w stronę silników agentycznych. Project Glasswing, w ramach którego testowany jest Mythos, pokazuje systemy zdolne do autonomicznego wykrywania i łańcuchowania luk typu zero-day w popularnych systemach operacyjnych i przeglądarkach. Pojawia się jednak fundamentalne pytanie o nadzór nad modelem, który potrafi przeprowadzić atak w czasie dziesięciokrotnie krótszym niż ludzki ekspert.
Od czatu do agentycznych działań
W przeciwieństwie do wcześniejszych iteracji, linia Mythos jest zorientowana na wysokospecjalistyczne zastosowania. Oceanus kładzie nacisk na zaawansowane rozumowanie, programowanie oraz cyberbezpieczeństwo. Pierwsze przecieki dotyczące możliwości modelu w bibliotekach takich jak Three.js sugerują, że potrafi on generować złożone modele 3D przy minimalnym nakładzie pracy. Anthropic sam przyznaje, że model znalazł już tysiące poważnych podatności, w tym 27-letnią lukę w OpenBSD oraz błąd w FFmpeg, który przetrwał 16 lat mimo wielokrotnych skanów tradycyjnymi narzędziami.
Walka o ułamki sekund i spójność kodu
Równolegle z testami Oceanusa, Anthropic wskazuje na potężny wzrost wydajności procesów rozwojowych. Według danych firmy, wczesne wersje Mythos pozwoliły na 52-krotne przyspieszenie optymalizacji treningu innych systemów AI. System osiągnął też wynik 83,1% w benchmarku CyberGym, mierzącym zdolność do odtwarzania znanych podatności. Anthropic nie kryje skali możliwości swojego narzędzia. W dokumentacji AWS podkreślono: „Claude Mythos Preview is a new class of intelligence built for ambitious projects focusing on cybersecurity, autonomous coding, and long-running agents”.
Kontekst rynkowy: Starcie gigantów
Pojawienie się Oceanusa w czerwcu nie jest przypadkowe. W tym samym czasie OpenAI szykuje nowe wersje modeli kindle-alpha i kepler-alpha. Anthropic gra jednak bardzo ostrożnie – ich nowy model jest określany jako „najbardziej stabilny psychicznie”, a mimo to System Card liczy aż 244 strony szczegółowych analiz ryzyka, w tym opisów potencjalnie destrukcyjnych akcji systemu. Choć model prawdopodobnie trafi początkowo wyłącznie do odbiorców korporacyjnych w ramach pakietów Claude Security, jego wpływ na bezpieczeństwo globalnej sieci będzie odczuwalny natychmiastowo. Pytaniem pozostaje, czy tak potężne narzędzie zdolne do samodzielnego łączenia od 3 do 5 luźnych podatności w pełne ścieżki ataku, kiedykolwiek powinno trafić do szerokiego grona użytkowników wersji Pro.
