LLM

Google tnie marnotrawstwo tokenów. Gemini 3.5 Flash Low ratuje budżety w Antigravity

Google w końcu przyznało, że ich najszybsze modele bywają zbyt gadatliwe tam, gdzie wystarczyłoby kilka linijek kodu. Programiści pracujący w środowisku Antigravity otrzymali właśnie dedykowane narzędzie: model Gemini 3.5 Flash Low. To bezpośrednia odpowiedź na frustrację inżynierów, którzy obserwowali, jak proste zadania błyskawicznie drenują ich limity tokenów.

Dlaczego to ważne właśnie teraz? W świecie zdominowanym przez wyścig na parametry, Google wykonuje ruch w przeciwną stronę — stawia na efektywność kosztową. Nowy wariant redukuje generowanie tokenów o średnio 45 procent w porównaniu do wersji Medium. Dla firm budujących oprogramowanie w oparciu o API Google to realna oszczędność, która pozwala utrzymać tempo pracy bez ciągłego odbijania się od sufitu limitów, szczególnie że gigant właśnie zresetował wszystkie przydziały zasobów na bieżący tydzień.

Koniec z marnotrawstwem zasobów AI

Mountain View koryguje kurs po fali krytyki ze strony programistów. Choć firma wcześniej dziewięciokrotnie zwiększała limity dla modelu Gemini 3.5 Flash, właściwe rozwiązanie problemu przyszło dopiero z przebudową architektury samych zapytań. Wprowadzenie wariantu Low ma za zadanie drastycznie obniżyć koszt operacyjny rutynowych zadań inżynieryjnych. Technologia ta czerpie z wcześniejszych doświadczeń z architekturą Mixture-of-Experts (MoE), która pozwalała na lepszą wydajność przy mniejszym zużyciu mocy obliczeniowej.

Pragmatyczny rebranding: Low, Medium i High

Nowa struktura oferty to przede wszystkim rebranding wymuszony przez codzienność pracy deweloperskiej. Dotychczasowy wariant standardowy zyskał miano Medium. Nowa wersja Low staje się narzędziem do mniej wymagających obliczeniowo poleceń, zachowując przy tym pełną świadomość kontekstu. Co ciekawe, ta lekka odsłona okazuje się sprawniejsza w kodowaniu niż starszy Gemini 3 Flash, który obecnie spadł do kategorii modelu High.

Przyznanie się do błędu w Google DeepMind

To rzadki przypadek, gdy gigant tak otwarcie mówi o błędach w projektowaniu. Varun Mohan z Google DeepMind przyznał, że zespół testujący model skupił się na najbardziej złożonych scenariuszach. Przez to przeoczono nieefektywność algorytmu przy najprostszych komendach. Społeczność Antigravity odebrała to jako testowanie produktu na żywym organizmie klientów. Model Low potrafi już inteligentnie skalować „wysiłek” do realnego stopnia trudności zadania, co wpisuje się w szerszy mechanizm dynamicznego myślenia promowany przez Google.

Nowe rozdanie w planach subskrypcyjnych

Wraz ze zmianami technicznymi, Google zdecydowało się na całkowity reset przydziałów we wszystkich wariantach płatnych i darmowych. Programiści zaczynają pracę z odświeżonymi pulami zasobów. Warto jednak zauważyć, że ta zmiana omija użytkowników domowych. Wariant Low jest rozwiązaniem specyficznym dla środowiska inżynieryjnego. Sugeruje to, że problem nieefektywnego zużycia zasobów był ściśle powiązany ze sposobem, w jaki profesjonalne narzędzia analizują i piszą kod przez AI.