Agentic Vision: Gemini 3 Flash przestaje tylko patrzeć, a zaczyna badać obrazy
Koniec z pasywną analizą pikseli
Tradycyjne modele wizyjne operują w schemacie jednoprzebiegowym: otrzymują obraz, analizują go i zwracają wynik. Jeśli istotny detal jest zbyt mały lub niewyraźny, system często ucieka się do halucynacji lub błędnych wniosków. Google DeepMind postanowiło przełamać to ograniczenie, wprowadzając do modelu Gemini 3 Flash funkcję „Agentic Vision”. Nowe podejście pozwala modelowi na interakcję z obrazem w pętli decyzyjnej, przypominającej działanie ludzkiego oka wspieranego narzędziami analitycznymi.
Pętla Think-Act-Observe
Kluczem do nowej funkcjonalności jest integracja środowiska wykonawczego Python. Zamiast polegać wyłącznie na własnych wagach neuronowych, Gemini 3 Flash może samodzielnie generować i uruchamiać skrypty pozwalające na przycinanie, powiększanie, a nawet nanoszenie adnotacji na analizowane grafiki. Proces odbywa się w cyklu: model formułuje plan, wykonuje kod, a następnie analizuje przetworzony fragment, który trafia z powrotem do okna kontekstowego.
Według danych Google, takie podejście przekłada się na wzrost jakości wyników o 5 do 10 procent w standardowych benchmarkach wizyjnych. Ma to szczególne znaczenie w zadaniach wymagających precyzji, jak np. liczenie drobnych obiektów czy analiza skomplikowanych schematów technologicznych.
Zastosowania w architekturze i matematyce
Praktyczny potencjał Agentic Vision dostrzegły już pierwsze firmy. Startup PlanCheckSolver wykorzystuje ten model do weryfikacji projektów budowlanych pod kątem zgodności z przepisami. Gemini potrafi samodzielnie wyizolować detale konstrukcyjne, takie jak krawędzie dachu, analizując je w wysokiej rozdzielczości bez utraty kontekstu całej budowli. Z kolei w zadaniach matematycznych model nie tylko odczytuje dane z tabel, ale przelicza je w środowisku Python, co eliminuje błędy liczone „w pamięci” i pozwala na generowanie czytelnych wykresów wynikowych.
Ograniczenia i dostępność
Although the technology is impressive, Google openly admits that it is not yet fully autonomous. While zooming in on details works automatically, more advanced operations, such as image rotation or specific visual-mathematical calculations, still require concrete instructions from the user. Currently, the function is limited exclusively to the lightest model in the family – Flash.
Użytkownicy mogą testować nowe możliwości w Google AI Studio oraz poprzez Vertex AI. Integracja z aplikacją Gemini już się rozpoczęła – funkcja jest dostępna pod zakładką „Thinking” w menu wyboru modelu. Deweloperzy zapowiadają, że w przyszłości Agentic Vision trafi do większych jednostek obliczeniowych i zostanie wzbogacone o narzędzia takie jak wyszukiwanie wsteczne obrazem.
