GPT-6 Sol i Luna: o połowę taniej, ale bez skoku jakości
OpenAI wprowadza do oferty dwa nowe modele z rodziny GPT-6. Sol i Luna mają jedną główną zaletę: są o połowę tańsze od poprzedników. I to właściwie cała nowość, bo w testach możliwości niewiele się zmienia.
Za milion tokenów wejściowych GPT-6 Sol zapłacimy 2 dolary, za wyjściowe 10. Luna kosztuje odpowiednio 0,10 i 0,50 dolara. Poprzednia generacja wyceniona była dwukrotnie wyżej: GPT-5.6 Sol kosztował 4 i 20 dolarów, a GPT-5.6 Luna – 0,20 i 1,20. OpenAI tłumaczy obniżki ulepszeniami w cache’owaniu i inferencji i przekonuje, że oszczędności trafiają bezpośrednio do użytkowników. Ceny nowych modeli zbliżają się tym samym do tańszych modeli open-weight. Z oferty zniknęła też Terra, dotychczas najtańszy model.
Dwa modele, dwie role
Sol ma być narzędziem do powtarzalnych, złożonych zadań: budowania nowych funkcji, przeglądu kodu, debugowania i analizy danych. Luna z kolei ma obsługiwać duże wolumeny prostych, dobrze określonych zadań – streszczanie dokumentów, wyciąganie informacji, krótkie odpowiedzi.
OpenAI poprawiło też prompt caching. Tokeny wejściowe odczytane z cache kosztują o 90 proc. mniej, a programiści dostali nowy dashboard z diagnostyką, który ma pomóc optymalizować wykorzystanie cache. Zmiana poziomu rozumowania lub dostępnych narzędzi nie unieważnia już cache. Na start modele są dostępne w ChatGPT Work i Codex dla subskrybentów Plus, Pro, Business, Enterprise i Edu. Użytkownicy Free i Go otrzymają dostęp do Luny przez aplikację desktopową. W standardowym czacie ChatGPT na razie ich nie ma, a wdrażanie odbywa się stopniowo. W API to odpowiednio gpt-6-sol i gpt-6-luna.
Benchmarki: lepszy stosunek ceny do możliwości
OpenAI pozycjonuje nowe modele przede wszystkim jako tańszą alternatywę dla flagowych modeli Anthropica. W teście OSWorld 2.0, sprawdzającym obsługę komputera, GPT-6 ma osiągać wyniki zbliżone do Claude Opus 5, ale przy koszcie niższym o około 80 proc. W kategorii wciąż prowadzi jednak Astra. Z kolei w AutomationBench, teście procesów biznesowych na 47 narzędziach, GPT-6 Sol na najwyższym poziomie wysiłku ma pokonywać Claude Opus 5 przy maksymalnym wysiłku. Koszt jednego zadania to 9 proc. kosztu Opusa. Luna poprawiła wynik poprzednika o 5,4 pkt proc., kosztując 58 proc. mniej.
W benchmarku kodowania FrontierCode 1.1, który sprawdza, czy agent wytwarza kod możliwy do wdrożenia w istniejący projekt, GPT-6 Sol zdobywa 49,3 proc. przy maksymalnym wysiłku i koszcie 2,14 dolara za zadanie. Claude Fable 5.1 notuje 50,3 proc., ale za 12,83 dolara, a Claude Opus 5 – 53,4 proc. za 4,31 dolara przy średnim wysiłku, który dał mu najlepszy wynik w tym teście.
Wewnętrzna konkurencja OpenAI
Na DeepSWE v1.1, benchmarku wymagających zadań inżynierii oprogramowania, Sol przy maksymalnym wysiłku osiąga 68,8 proc. To o 1,1 pkt proc. mniej niż najlepszy wynik Claude Fable 5 (69,9 proc. na poziomie „xhigh”), choć Fable na poziomie „max” osiąga 69,7 proc. i kosztuje 21,63 dolara za zadanie. Liderem pozostaje Claude Opus 5: 73,7 proc. za 11,84 dolara. Co ciekawe, poprzedni model OpenAI, GPT-5.6 Sol, daje 72,7 proc. za 6,46 dolara. Nowy Sol nie ma więc gonić liderów za wszelką cenę – ma zbliżyć się do ich wyników za ułamek pieniędzy. Na poziomie „xhigh” osiąga 66,6 proc. za dokładnie 1 dolara. Luna ten sam wynik powtarza przy maksymalnym wysiłku za 0,22 dolara.
To zestawienie stawia jednak klientów przed trudnym wyborem. Luna przy maksymalnym wysiłku dorównuje Solowi na poziomie „xhigh”, kosztując 78 proc. mniej. Ciężko w tym układzie uzasadnić dopłatę do Sola – chyba że ktoś naprawdę potrzebuje najlepszego wyniku, jaki ten model potrafi wykrzesać. OpenAI zaczyna być swoim własnym największym konkurentem.
Wybór benchmarków i wątpliwości
Ogólna selekcja testów wygląda jednak na starannie przesianą. W zapowiedzi brakuje GDPval dla pracy opartej na wiedzy czy Terminal-Bench 4.0 do oceny agentów w terminalu, choć zwykle pojawiają się w podobnych zestawieniach.
Niezależna analiza studzi nastroje. Artificial Analysis wylicza, że koszt pojedynczego zadania w GPT-6 Sol i Luna spadł o połowę względem poprzedników, ale wyniki testów inteligencji pozostały na poziomie GPT-5.6. W indeksie możliwości Sol zyskuje jeden punkt (47–48), Luna stoi w miejscu z 37 punktami. W indeksie agentów kodujących Sol poprawia się o 2 punkty, a Luna traci 2. Na GDPval-AA v2.1, teście pracy biurowej w 44 zawodach, Sol traci około 100 punktów Elo, a Luna – 75. Analitycy wskazują przede wszystkim na niższą jakość prezentacji odpowiedzi i niepełne wyniki.
Do wyliczeń Artificial Analysis warto jednak podchodzić ostrożnie. Ta sama firma wcześniej mocno zaniżyła możliwości modelu Astra z powodu nieaktualnych benchmarków; po dwóch aktualizacjach Astra wróciła na szczyt. Jak będzie tym razem, przekonamy się przy okazji kolejnych testów.
Jedno jest dziś pewne: OpenAI postawiło na cenę. GPT-6 Sol i Luna muszą udowodnić swoją wartość w codziennej pracy, bo benchmarki – zwłaszcza te wybrane przez producenta – opowiadają tylko część historii.
