NVIDIA otwiera kod dla robotaksówek. Alpamayo 2 Super rzuca wyzwanie zamkniętym systemom
NVIDIA wykonała właśnie ruch, który uderza w fundamenty dotychczasowego rynku autonomicznych pojazdów. Zamiast budować kolejne zamknięte oprogramowanie, firma udostępniła Alpamayo 2 Super – potężny model klasy Vision-Language-Action (VLA) o 34 miliardach parametrów. Ten system potrafi nie tylko sterować autem, ale też logicznie uzasadniać każdy wykonany skręt czy hamowanie.
Dlaczego to ważne? Po raz pierwszy deweloperzy otrzymują narzędzie, które według słów przedstawicieli NVIDII pozwala – – – „rozumować, planować i działać w całym stosie jazdy” przy jednoczesnym zachowaniu otwartości komercyjnej. Dzięki licencji OpenMDW-1.1 firmy mogą wdrażać i modyfikować ten model we własnych flotach bez płacenia haraczu licencyjnego, co drastycznie obniża próg wejścia dla mniejszych graczy w sektorze robotaksówek.
Architektura do zadań specjalnych
Sercem Alpamayo 2 Super jest hybrydowe podejście do danych. Fundament stanowi 32-miliardowy trzon wizualno-językowy NVIDIA Cosmos 3 Super Reasoner. Współpracuje on z dekoderem akcji o rozmiarze 2,3 miliarda parametrów, opartym na modelach dyfuzyjnych. Taka konstrukcja pozwala na analizę obrazu w 360 stopniach z wykorzystaniem nawet siedmiu kamer jednocześnie. To klucz do zrozumienia pełnego kontekstu ruchu pojazdu i otoczenia.
Model generuje w jednym cyklu pełną sekwencję 64 punktów drogi (waypointów) obejmującą 6,4 sekundy. Kluczowym elementem dla bezpieczeństwa jest tzw. Chain-of-Causation (CoC). To strukturalne wyjaśnienie przyczynowo-skutkowe każdej decyzji. Inżynierowie mogą sprawdzić, dlaczego system wybrał dany manewr, co ułatwia spełnienie norm bezpieczeństwa takich jak ISO/PAS 8800.
Dominacja w testach i praktyczna efektywność
Wyniki w benchmarkach pokazują dystans, jaki dzieli Alpamayo od konkurencji. W teście LingoQA model uzyskał 79,2 pkt, zostawiając GPT-4o daleko w tyle o ponad 23 punkty. NVIDIA nazywa go zresztą „najpotężniejszym otwartym modelem rozumującym do tej pory”. Poza samą jazdą, narzędzie to rewolucjonizuje przygotowanie danych. Jako auto-labeler potrafi skrócić miesięczne cykle opisywania nagrań wideo do zaledwie kilku dni.
Od chmury do krawędzi sieci
Pełna wersja modelu dostępna na platformie Hugging Face wymaga ogromnej mocy obliczeniowej – testy na GPU H100 80GB pochłaniały ponad 70 GB VRAM. Jednak dzięki udostępnieniu kodu źródłowego na licencji Apache 2.0, deweloperzy mogą przeprowadzić destylację wiedzy do mniejszych jednostek. W ten sposób odchudzone algorytmy mogą działać w czasie rzeczywistym bezpośrednio w komputerach pokładowych aut, zachowując precyzję pierwowzoru.
