Bez kategorii

Koszt osiągnięcia dawnego poziomu w testach AI spada 13-krotnie w ciągu roku. Algorytmy to tylko część układanki

Osiągnięcie poziomu, który na początku 2025 roku wymagał uruchomienia modelu o3, kosztuje dziś ułamek ówczesnej ceny. Według analizy organizacji Epoch AI uzyskanie 75 proc. poprawnych odpowiedzi w teście naukowym GPQA Diamond przy użyciu o3 oznaczało wydatek około 30 centów za pytanie. W przypadku nowszego modelu GPT-5.6 Luna ten sam próg osiągnięto za około 0,04 centa — czyli niemal 725 razy taniej.

Epoch AI, monitorująca tempo rozwoju sztucznej inteligencji na podstawie pięciu wybranych benchmarków z matematyki, nauk ścisłych i łamigłówek, szacuje średni kwartalny spadek kosztu osiągnięcia określonego wyniku na 47 proc. W skali roku oznacza to około 13-krotną obniżkę cen. Badacze zaznaczają jednak, że ich obliczenia są przybliżonym pomiarem cen rynkowych, a nie bezpośrednią miarą samego postępu algorytmicznego czy ogólnego spadku kosztów korzystania ze sztucznej inteligencji.

Rynkowe stawki a realny postęp algorytmów

Inne spojrzenie na te same trendy przynosi badanie naukowców z MIT, którzy przeanalizowali dane platformy Artificial Analysis z okresu od kwietnia 2024 do listopada 2025 roku. Choć oszacowali, że koszty spadają 5–10-krotnie w ciągu roku, podjęli próbę odseparowania wpływu tańszego sprzętu komputerowego oraz presji konkurencyjnej między dostawcami. Po wyłączeniu tych zmiennych poprawa samej efektywności algorytmicznej odpowiada za około trzykrotne obniżenie kosztów w skali roku — znacznie mniejsze niż sugerują zmiany cenników API.

Na interpretację wyników testów wpływa również specyfika modeli rozumujących. Systemy tego typu potrafią przeznaczyć znacznie więcej zasobów obliczeniowych na pojedynczą odpowiedź podczas wnioskowania. Wyższy wynik w benchmarku bywa więc efektem dłuższego generowania tokenów i większego nakładu obliczeniowego na konkretne pytanie, a nie wyłącznie bardziej zwartej czy efektywnej architektury modelu.

W rezultacie powstaje wyraźny kontrast: odtworzenie dawnego poziomu możliwości na znanych testach staje się bardzo tanie, ale uruchomienie aktualnego modelu rozumującego na trudnym zadaniu może kosztować więcej za pojedyncze zapytanie niż w przypadku starszych systemów. Sama cena za milion tokenów nie przesądza o ostatecznym rachunku — decydują o nim także liczba generowanych kroków myślowych, opóźnienie oraz to, jak często model podaje poprawną odpowiedź bez konieczności ponawiania prób.