Gemini 4 Argon z limitem miliona tokenów wyjściowych. Na wdrożenie trzeba jeszcze poczekać
Google zaprezentowało Gemini 4 Argon – model zaprojektowany do obsługi długich, złożonych zadań programistycznych oraz pracy z rozbudowaną wiedzą firmową. Najważniejszą zmianą techniczną jest podniesienie maksymalnego limitu wyjścia z 64 tys. do miliona tokenów. W praktyce umożliwia to wygenerowanie setek tysięcy tokenów w ramach jednego przebiegu, choć maksymalny pułap nie oznacza, że każda generowana odpowiedź będzie osiągać taką długość.
Na powszechną dostępność nowego narzędzia trzeba będzie jednak poczekać. Google zdecydowało się na stopniowe wdrażanie, zaczynając od wąskiej grupy odbiorców. W pierwszej kolejności Argon trafia do zaufanych specjalistów ds. cyberbezpieczeństwa w ramach programu Fairwind oraz do wewnętrznych zespołów inżynierskich koncernu.
Etapy wdrożenia i zabezpieczenia
Ograniczone wdrożenie wiąże się z dopracowywaniem zabezpieczeń. Zaufani partnerzy w programie Fairwind mają otrzymać wersję przystosowaną do zadań defensywnych, podczas gdy Google rozwija mechanizmy chroniące przed nadużyciami w cyberprzestrzeni, zagrożeniami CBRN, atakami polegającymi na pośrednim wstrzykiwaniu promptów (indirect prompt injection) oraz nieprzewidywalnym zachowaniem autonomicznych agentów. Przed szerszym udostępnieniem technologii firma zapowiada również przygotowanie utwardzonych środowisk izolowanych do testów wysokiego ryzyka.
Kolejnym etapem ma być udostępnienie modelu klientom korzystającym z płatnego dostępu do API oraz subskrybentom Google AI Ultra, a w dalszej kolejności – pozostałym użytkownikom. Dokładny termin szerszego wdrożenia nie został jednak podany.
Ceny i pamięć podręczna
Google przedstawiło także strukturę opłat za korzystanie z nowego modelu. W początkowym okresie promocyjnym stawki wynoszą 2 dolary za milion tokenów wejściowych oraz 10 dolarów za milion tokenów wyjściowych. Docelowo ceny mają wzrosnąć odpowiednio do 4 i 20 dolarów. Przewidziano również 95-procentową zniżkę na tokeny wejściowe pobierane z pamięci podręcznej, co ma obniżyć koszty przy przetwarzaniu powtarzalnych, dużych porcji danych.
