NVIDIA przełamuje barierę minuty: SANA-WM generuje wideo wysokiej rozdzielczości na pojedynczej karcie graficznej
W sektorze sztucznej inteligencji ukierunkowanej na robotykę i symulację (tzw. embodied AI) „modele świata” stanowią święty Graal rozwoju technologii. Zdolność do syntezy realistycznych sekwencji wideo na podstawie pojedynczego obrazu i zadanej trajektorii ruchu pozwala maszynom „wyobrażać sobie” skutki działań przed ich podjęciem. Dotychczas jednak generowanie długich, minutowych nagrań w wysokiej jakości wymagało potężnych klastrów złożonych z wielu jednostek GPU, co czyniło tę technologię mało praktyczną w szerszym wdrożeniu. NVIDIA rzuciła wyzwanie tym ograniczeniom, prezentując model SANA-WM.
Architektura GDN: rozwiązanie problemu pamięci
Kluczową barierą w generowaniu długich filmów była do tej pory kwadratowa złożoność standardowych mechanizmów uwagi (softmax attention). Przy tworzeniu 60-sekundowego materiału w rozdzielczości 720p model musi przetworzyć niemal tysiąc klatek latentnych, co błyskawicznie zapycha pamięć operacyjną nawet najmocniejszych kart graficznych. Inżynierowie NVIDIA rozwiązali ten problem, wprowadzając Gated DeltaNet (GDN) – formę liniowej uwagi, która operuje w trybie ramkowym.
W przeciwieństwie do poprzednich rozwiązań GDN nie gromadzi bezkrytycznie wszystkich informacji z przeszłości, co wcześniej prowadziło do wizualnego „dryfu” i degradacji obrazu. Nowy system wykorzystuje bramkę zapominania (γ) oraz korektę typu delta, która aktualizuje stan modelu tylko o istotne różnice między przewidywanym a rzeczywistym stanem. Dzięki temu zapotrzebowanie na pamięć pozostaje stałe niezależnie od długości generowanego filmu. Aby jednak nie stracić na jakości szczegółów, architekturę oparto na hybrydzie: 15 bloków GDN przeplatanych jest 5 blokami klasycznej uwagi, co zapewnia balans między wydajnością a spójnością przestrzenną.
Precyzyjna kontrola w sześciu stopniach swobody
SANA-WM wyróżnia się na tle konkurencji nie tylko długością materiału, ale i chirurgiczną precyzją w odwzorowaniu ruchu kamery (6-DoF). Tradycyjne modele świata często „pływają”, gubiąc perspektywę przy złożonych manewrach. NVIDIA zastosowała tutaj podejście dwuścieżkowe. Gałąź zgrubna odpowiada za ogólną strukturę trajektorii w całej sekwencji, natomiast gałąź precyzyjna, wykorzystująca mapy promieni Plückera, zajmuje się niuansami ruchu zachodzącymi wewnątrz pojedynczych interwałów kompresji VAE.
Efekty są widoczne w liczbach: model osiąga znacząco niższe błędy rotacji i translacji niż systemy o znacznie większej liczbie parametrów, takie jak LingBot-World czy HY-WorldPlay. Co istotne, SANA-WM osiąga to przy rozmiarze zaledwie 2,6 miliarda parametrów, co jest wartością skromną w dobie gigantycznych modeli językowych.
Wydajność, która zmienia zasady gry
Największe wrażenie robi jednak efektywność ekonomiczna projektu. Podczas gdy konkurencyjne rozwiązania wymagają 8 jednostek H100 do wygenerowania niespełna jednego filmu na godzinę, SANA-WM na tej samej infrastrukturze potrafi dostarczyć ich 22. Wersja wydestylowana modelu potrafi wygenerować 60 sekund wideo w zaledwie 34 sekundy na pojedynczej domowej karcie RTX 5090, korzystając z kwantyzacji NVFP4.
Proces generowania składa się z dwóch etapów. Pierwszy tworzy spójną strukturę wideo, a drugi – lekki refiner oparty na modelu LTX-2 – koryguje artefakty wizualne. Takie rozdzielenie ról pozwoliło autorom utrzymać wysoką ostrość obrazu bez konieczności kosztownego douczania całego ogromnego systemu na długich sekwencjach. NVIDIA zadbała również o stronę danych, modernizując silniki adnotacji, aby umożliwić precyzyjne śledzenie głębi i parametrów kamery w materiałach wideo pozyskanych z internetu.
Otwartość i przyszłość symulacji
Wypuszczając SANA-WM na licencji open-source, NVIDIA dostarcza badaczom i twórcom narzędzie o bezprecedensowej dostępności. Mimo pewnych ograniczeń, takich jak brak jawnej pamięci trójwymiarowej sceny, co może prowadzić do niespójności przy nagłych powrotach do tych samych punktów widzenia, model wyznacza nowy standard. Możliwość uruchomienia zaawansowanego modelu świata na pojedynczym GPU otwiera drzwi do masowego testowania algorytmów nawigacyjnych w bezpiecznych, wirtualnych środowiskach o kinowej jakości.
