Agenci AI

Nvidia stawia na szybkość: Nemotron 3.5 Lightning rzuca wyzwanie gigantom wydajnością

W świecie zdominowanym przez wyścig o jak najwyższe parametry inteligencji, Nvidia wykonuje zwrot w stronę czystej efektywności operacyjnej. Premiera modelu Nemotron 3.5 Lightning sygnalizuje nową strategię giganta z Santa Clara – zamiast budować kolejne cyfrowe wyrocznie, inżynierowie skupili się na stworzeniu wysokoprzepustowego narzędzia roboczego, które ma szansę zmienić architekturę systemów agentowych.

To ważny moment dla rynku, ponieważ Nvidia dostarcza model zoptymalizowany pod masowy użytek w systemach działających nonstop. Według producenta, Lightning został zbudowany dla zawsze aktywnych agentów, by szybciej wykonywać wyspecjalizowane zadania o dużym wolumenie. Dzięki wysokiej wydajności i rekordowej szybkości wnioskowania, model ten wypełnia lukę między powolnymi gigantami a małymi, często zbyt prostymi algorytmami.

Hybrydowa architektura w służbie przepustowości

Model Nemotron 3.5 Lightning kontynuuje ewolucję hybrydowej architektury Mamba-Transformer. Przy całkowitej liczbie około 30 miliardów parametrów, w danej chwili aktywnych pozostaje jedynie 3 miliardy, co kwalifikuje go do kategorii rozwiązań lekkich i niezwykle zwinnych. Takie podejście pozwala na osiągnięcie niemal 670 tokenów na sekundę, co przekłada się na nawet czterokrotnie wyższą szybkość wyjścia względem modeli o podobnych rozmiarach. W praktyce zadania analityczne, które konkurencji zajmują kilka minut, Lightning kończy w zaledwie trzydzieści sekund.

Efektywna alternatywa dla gigantów

Choć pod względem czystej inteligencji modele takie jak Muse Glimmer od Meta wciąż utrzymują przewagę, Nvidia celuje w inny punkt krzywej opłacalności. Niezależne testy Artificial Analysis wskazują, że nowy model oferuje wydajność zbliżoną do gpt-oss-120b przy zaledwie jednej czwartej całkowitej liczby parametrów. To namacalny dowód na to, że mniejsze jednostki przy odpowiedniej optymalizacji mogą obsługiwać złożone potoki pracy przy ułamku kosztów operacyjnych.

Przełom w zadaniach agentowych

Największym zaskoczeniem są wyniki w konkretnych scenariuszach użytkowych. Na benchmarku PinchBench model uzyskał 86% dokładności, co pokazuje jego realną użyteczność. W porównaniu do konkurencyjnego Qwen3.6 35B, Lightning wykonuje 10 000 zadań o 30% szybciej, zachowując przy tym spójną precyzję. Dzięki oknu kontekstowemu wynoszącemu milion tokenów, staje się on idealnym fundamentem pod autonomiczne systemy AI analizujące całe biblioteki dokumentów w czasie rzeczywistym.

Dostępność i licencjonowanie

Nvidia udostępnia wagi modelu na liberalnej licencji OpenMDW-1.1, co otwiera drzwi dla szerokiej implementacji komercyjnej. Model jest dostępny zarówno w formacie BF16, jak i zoptymalizowanym NVFP4. Infrastrukturę do bezserwerowego wnioskowania zapewniają już czołowi dostawcy chmurowi, co sugeruje, że Lightning może szybko stać się standardem w szybkim prototypowaniu i skalowaniu agentów AI.