Google optymalizuje koszty agentów AI: Gemini 3.6 Flash i 3.5 Flash-Lite wchodzą do gry
Zamiast ścigać się na miliardy parametrów, Google zaczęło liczyć pieniądze swoich klientów. Premiera modeli Gemini 3.6 Flash oraz 3.5 Flash-Lite to jasny sygnał: era zachwytu czystą inteligencją mija, a zaczyna się twarda optymalizacja budżetów wdrożeniowych. Gigant z Mountain View uderza w najczulszy punkt firm budujących autonomiczne systemy AI – ogromne koszty generowania tokenów, które do tej pory potrafiły spalić budżet projektu zanim ten wyszedł z fazy beta.
Dlaczego to ważne teraz
W 2026 roku o sukcesie sztucznej inteligencji w biznesie nie decyduje już tylko to, co model potrafi, ale jak szybko i tanio potrafi to dowieźć. Nowe modele Gemini drastycznie obniżają bariery wejścia, tniąc opłaty za tokeny wyjściowe i wprowadzając specjalizacje, które pozwalają na tworzenie wielopoziomowych, oszczędnych architektur agentowych. Jak podają Źródła analityczne, nowa oferta jest o około 25% tańsza niż popularna wersja 3.1 Pro.
Efektywność mierzona w tokenach
Najistotniejszą innowacją w Gemini 3.6 Flash jest drastyczna redukcja liczby generowanych tokenów wyjściowych. Według danych Google, model ten zużywa ich o 17% mniej niż poprzednik przy zachowaniu tej samej sprawności. W specyficznych testach syntetycznych, takich jak Datacurve DeepSWE, oszczędność ta sięga nawet 65%. „Dla firm operujących tysiącami zapytań na godzinę to różnica, która decyduje o rentowności całego systemu” – czytamy w dokumentacji technicznej. Przy cenach rzędu 1,50 dolara za milion tokenów wejściowych, model ten staje się naturalnym wyborem dla pętli rozumowania pracujących bez przerwy.
Poprawa wydajności idzie w parze z konkretnymi wynikami w zadaniach programistycznych. W teście MLE Bench wynik wzrósł z 49,7% do blisko 64%, co dowodzi, że Google udało się połączyć oszczędność z inteligentniejszymi odpowiedziami. Praktyczne zastosowania widać już u partnerów – Figma wykorzystuje Gemini 3.6 Flash do szybkich iteracji projektowych, a platformy finansowe Hebbia zaprzęgają model do analizy wykresów i dokumentacji.
Specjalizacja zamiast jednego modelu do wszystkiego
Google wyraźnie stawia na segmentację. Obok wersji 3.6 Flash zadebiutował Gemini 3.5 Flash-Lite, dedykowany zadaniom o niskim poziomie skomplikowania, ale gigantycznym wolumenie. Z prędkością 350 tokenów na sekundę jest to najszybsza jednostka w serii. Jej cena – zaledwie 0,30 dolara za milion tokenów wejściowych – pozwala inżynierom budować struktury, gdzie proste zadania wykonuje tani subagent, a droższe zasoby Gemini Pro są rezerwowane tylko na krytyczne momenty.
Bezpieczeństwo i narzędzia systemowe
Interesującym ruchem jest integracja narzędzi typu computer-use bezpośrednio w API Gemini. Eliminuje to potrzebę budowania pośredniego oprogramowania, które pozwalałoby modelowi operować na systemie operacyjnym. Google chwali się wynikiem 83% w teście OSWorld, co sugeruje dużą biegłość w nawigacji po interfejsach graficznych.
Osobną kategorię stanowi Gemini 3.5 Flash Cyber. To wyspecjalizowany model do łatania podatności w kodzie, który jest dostępny wyłącznie dla rządów i zweryfikowanych partnerów. Ten bezpiecznik ma zapobiec wykorzystaniu AI do celów ofensywnych. To kompleksowe podejście pokazuje, że Google zamiast gonić za kolejnymi parametrami, skupia się na budowie technologii, która jest po prostu opłacalna i bezpieczna w codziennym biznesie.
