Bez kategorii

Gemini 4 Pro: co naprawdę widać w pierwszych przeciekach z wewnętrznych testów Google

Na X pojawiły się pierwsze wyniki testów wewnętrznego modelu Google o kodowej nazwie „argon”. Według nieoficjalnych doniesień to wczesny checkpoint Gemini 4 Pro — Google nie potwierdził jednak ani istnienia modelu, ani publikowanych wyników. Cały szum opiera się na kilku postach użytkowników, nie na oficjalnych danych czy niezależnych benchmarkach.

Jako pierwszy o wewnętrznych testach wspomniał użytkownik Lentils, który napisał, że checkpointy modelu zaczęły pojawiać się wewnętrznie kilka dni temu. Jedynym konkretnym parametrem, jaki ujawniono, jest limit wyjściowy: 256 tys. tokenów wobec 64 tys. w poprzedniej generacji. To wyraźna zmiana specyfikacji, choć w praktyce może mieć znaczenie głównie przy bardzo długich odpowiedziach.

Większą uwagę przykuły efekty pracy modelu. Deweloper Bee pokazał na X monograficzną stronę internetową, którą „argon” wygenerował w 14 minut. Finalny projekt opisał jako czysty i dopracowany — co akurat wyróżnia się na tle opinii o Gemini, które we frontendzie zwykle bywa sztywne i szablonowe. Zastrzeżenie jest takie, że to wrażenie z jednego posta, a nie wynik z benchmarku.

Konto LuminaBench opublikowało z kolei test, w którym model miał wygenerować SVG kontrolera do Xboksa. Generowanie zajęło około 20 minut. Co ciekawe, test był prowadzony przez „gemini 3.7 flash” w środowisku arena, które po cichu kierowało zapytania do 4 Pro. Sam LuminaBench zastrzegł jednak, że następnego dnia nie udało mu się uzyskać podobnego rezultatu — trudno więc mówić o powtarzalnej poprawie, a nie pojedynczym trafieniu.

Google równolegle testuje też funkcję Projekty w aplikacji desktopowej Gemini. Ma ona pozwalać na tworzenie dedykowanych przestrzeni roboczych ze wspólnym kontekstem, plikami i instrukcjami, zamiast zaczynać każdą rozmowę od zera. To osobny wątek, dotyczący innego produktu niż model 4 Pro.

Na razie cała historia opiera się na nieoficjalnych postach, bez oficjalnego komunikatu Google i bez niezależnych testów. Nie wiadomo, czy opublikowane outputy były wybierane selektywnie, ani czy wyniki są powtarzalne między zapytaniami. To, co widać, to obiecujący sygnał — ale na razie tylko sygnał.