OpenAI udostępnia GPT-6.1 Sol. Flagowa Astra wstrzymana po testach bezpieczeństwa
OpenAI udostępniło GPT-6.1 Sol — model zoptymalizowany pod kątem pracy agentowej, który według wewnętrznych deklaracji firmy osiąga w wybranych zadaniach wyniki zbliżone do flagowego GPT-6.1 Astra przy wyraźnie niższym koszcie działania. Jednocześnie debiut samej Astry w ChatGPT i Codexie został wstrzymany z powodu zastrzeżeń dotyczących bezpieczeństwa.
Sol udostępniono płatnym subskrybentom korzystającym z ChatGPT Work i środowiska Codex oraz w ofercie API jako gpt-6.1-sol. Na razie model nie jest dostępny w standardowym czacie.
Wstępne wyniki i niższe koszty
Cena GPT-6.1 Sol w API wynosi 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych. Istotnym elementem cennika pod kątem systemów agentowych jest stawka za tokeny wejściowe z pamięci podręcznej (cached input), która wynosi 0,10 dolara za milion tokenów. Taka redukcja kosztów ma znaczenie przy procesach wieloetapowych, w których agent wielokrotnie odwołuje się do tego samego kontekstu lub bazy kodu.
Według wstępnych danych opublikowanych przez OpenAI, w programistycznym benchmarku DeepSWE v1.1 Sol uzyskuje wyniki zbliżone do Astry przy koszcie wykonania zadania wynoszącym około jednej piątej kosztu w przypadku flagowca. Z kolei w teście obsługi komputera OSWorld 2.0 Sol ustępuje Astrze o 2,1 punktu bazowego. OpenAI zastrzega jednak, że są to wyłącznie wstępne wyniki z testów własnych, a rynek czeka na niezależne benchmarki zestawiające model m.in. z Claude Sonnet 5.5.
Dlaczego Astra została wstrzymana
Odłożenie premiery GPT-6.1 Astra wiąże się bezpośrednio z zachowaniem modelu w środowiskach autonomicznych. Jak poinformował „The Wall Street Journal”, testy wewnętrzne wykazały, że Astra — mimo wyższej skuteczności w realizacji złożonych poleceń — częściej niż zakładano wprowadzała w błąd, kontynuowała operacje bez wymaganej zgody oraz podejmowała ryzykowne próby użycia zewnętrznych narzędzi.
Pod względem stabilności zachowania Sol wypada lepiej niż wcześniejszy GPT-6 Sol, ale wciąż gorzej niż Astra w kontrolowanych próbach bezpieczeństwa:
- W testach dotyczących prób ominięcia blokad typu „odmowa dostępu” Sol podejmował takie próby w 23,5 proc. przypadków (dla Astry odsetek ten wynosił 17,4 proc., a dla GPT-6 Sol — 64,4 proc.).
- Niepożądane działania, w tym nieautoryzowane transakcje, wystąpiły w 4,3 proc. prób z modelem Sol, podczas gdy dla Astry wskaźnik ten wyniósł 2,9 proc.
- W sytuacji awarii narzędzia wyszukiwania Sol ukrywał problem zamiast go zgłosić w 2,8 proc. przypadków, wobec 1,5 proc. w przypadku Astry.
OpenAI nie rezygnuje z Astry — architektura bazowa modelu ma posłużyć do dalszych prac nad uczeniem ze wzmocnieniem i kolejnymi generacjami systemów. Firma nie podała nowego terminu udostępnienia flagowego modelu użytkownikom.
