Modele fizyczne

Koniec z czekaniem na AI. Runway pokazuje interaktywne generowanie wideo

Obecny proces tworzenia wideo przez sztuczną inteligencję przypomina wysyłanie listu i czekanie na odpowiedź: użytkownik wpisuje polecenie, czeka, a jeśli wynik go nie satysfakcjonuje – zaczyna od nowa. Runway zamierza to zmienić, przechodząc z trybu ‐wpisz i czekaj‐ na interaktywny strumień, w którym obraz powstaje na bieżąco pod kontrolą użytkownika.

Sercem nowej technologii jest GWM-1 (General World Model), oparty na architekturze Gen-4.5. W przeciwieństwie do tradycyjnych modeli, które tworzą całe klipy w oddzielnych krokach, GWM-1 działa autoregresyjnie – generuje obraz klatka po klatce. Podczas pokazu na konferencji Nvidia GTC prototyp działający na platformie Vera Rubin dostarczał pierwszą klatkę w czasie poniżej 100 milisekund przy rozdzielczości HD.

Samodzielna korekta błędów

Największym wyzwaniem w generowaniu wideo na żywo jest tzw. kumulacja błędów. Ponieważ każda kolejna klatka budowana jest na podstawie poprzedniej, małe zniekształcenie może szybko narosnąć do poziomu, w którym obraz staje się nieczytelny. Runway twierdzi, że ograniczył ten problem poprzez specyficzny trening modelu.

Zamiast korygować wideo już po jego powstaniu, system uczy się na własnych błędach podczas procesu generowania. Pozwala mu to samodzielnie naprawiać drobne deformacje, zanim urosną one do poważnych defektów wizualnych. Takie podejście ma zapewnić stabilność obrazu w interaktywnym trybie, w którym użytkownik steruje kamerą, poleceniami głosowymi lub dźwiękiem.

Niższe koszty i nowe zastosowania

Przejście na generowanie w czasie rzeczywistym ma również wymiar ekonomiczny. Krótszy czas pracy procesorów graficznych (GPU) drastycznie obniża koszty produkcji sekundy obrazu. Może to otworzyć drzwi do zastosowań, które dotychczas były nieopłacalne, takich jak responsywne gry wideo czy zaawansowane narzędzia edukacyjne.

Ambicje Runway wykraczają jednak poza branżę kreatywną. Interaktywne wideo to także fundament dla robotyki i systemów autonomicznych. Model GWM-1 może służyć do tworzenia syntetycznych środowisk treningowych dla maszyn, podobnie jak robi to Waymo przy symulowaniu ekstremalnych sytuacji drogowych dla swoich autonomicznych taksówek.

  • Model działa w czasie rzeczywistym z opóźnieniem poniżej 100 ms.
  • Interaktywna kontrola obejmuje ruch kamery i polecenia dźwiękowe.
  • Uczenie na błędach zapobiega deformacjom obrazu.

Choć Runway nie ogłosił jeszcze daty publicznej premiery, zaprezentowane badania wskazują na zmianę sposobu interakcji z AI – z pasywnego oczekiwania na wynik w stronę płynnego, sterowalnego strumienia obrazu.