Koniec z halucynacjami miast – Naver tworzy cyfrowego bliźniaka Seulu na bazie Street View
Geometria zamiast fantazji
Większość obecnych generatywnych modeli wideo, choć potrafi stworzyć wizualnie spektakularne obrazy, operuje w całkowitej próżni topograficznej. Poza pierwszym kadrem wszystko, co widzimy – od układu ulic po wygląd odległych wieżowców – jest wynikiem statystycznego zgadywania algorytmu, czyli tak zwanych halucynacji. Naver, uznawany za koreański odpowiednik Google’a, postanowił radykalnie zmienić to podejście. Ich projekt Seoul World Model (SWM) to fundament nowej generacji systemów, które są ściśle zakotwiczone w rzeczywistej przestrzeni fizycznej.
Wykorzystując ogromną bazę 1,2 miliona zdjęć panoramicznych z własnej usługi mapowej, inżynierowie Naver stworzyli model, który rozumie strukturę miasta. Użytkownik nie tylko podaje prompt tekstowy, ale definiuje współrzędne GPS i trajektorię ruchu kamery. System pobiera najbliższe dane Street View i traktuje je jako szkielet, na którym nadbudowuje generowany obraz. Rezultat? Film, w którym Godzilla przechadza się między drapaczami chmur w Seulu, zachowując przy tym autentyczny układ ulic i elewacje budynków.
Problem „duchów” w Street View
Praca na realnych danych miejskich wiąże się z unikalnymi wyzwaniami, których nie znają modele operujące na syntetycznych zbiorach. Największym problemem okazały się same obiekty uchwycone na zdjęciach Street View – samochody i piesi, którzy w momencie robienia fotografii byli statycznymi elementami kadru. Gdyby model po prostu kopiował te dane, generowane wideo byłoby pełne „duchów” i nienaturalnie zamrożonych obiektów.
Badacze rozwiązali to za pomocą mechanizmu cross-temporal pairing. Trenowali model, zestawiając obrazy tej samej lokalizacji wykonane w różnych odstępach czasu. Dzięki temu sztuczna inteligencja nauczyła się odróżniać stałe struktury, takie jak fasady kamienic czy krawężniki, od obiektów efemerycznych – zaparkowanych aut czy przechodniów. Dodatkowo, aby uzupełnić luki w danych (zdjęcia Street View powstają zazwyczaj co 5-20 metrów), Naver wykorzystał silnik Unreal Engine i symulator CARLA do wygenerowania tysięcy syntetycznych sekwencji wideo, ucząc model płynności ruchu z perspektywy drona czy pieszego.
Stabilność na długich dystansach
Innowacją, która wyróżnia SWM na tle konkurencji, jest tak zwany virtual lookahead sink. Tradycyjne modele wideo szybko tracą spójność – po kilkuset metrach wirtualnej drogi obraz zazwyczaj rozmywa się lub deformuje. SWM eliminuje ten efekt, stosując „wirtualną kotwicę”. Podczas generowania sekwencji model nieustannie zerka w przód, pobierając z bazy danych zdjęcie punktu docelowego na trasie. Służy ono jako bezbłędny punkt kontrolny, zapobiegający kumulowaniu się drobnych błędów matematycznych, które w innych modelach prowadzą do kompletnego rozpadu obrazu.
Uniwersalność i przyszłość cyfrowych światów
Mimo że nazwa modelu sugeruje ograniczenie do stolicy Korei Południowej, SWM wykazał zdumiewające zdolności do generalizacji. Testy przeprowadzone w miastach, których model nigdy „nie widział”, takich jak Busan czy amerykańskie Ann Arbor, zakończyły się sukcesem. System bez dodatkowego douczania potrafił zmapować nową architekturę, korzystając z wypracowanych mechanizmów geometrycznych i wizualnych.
Choć technologia wciąż boryka się z pewnymi ograniczeniami, takimi jak błędy w metadanych czasowych, które skutkują nagłym pojawianiem się pojazdów, jej potencjał jest ogromny. Od planowania urbanistycznego, przez szkolenie systemów autonomicznej jazdy, aż po fotorealistyczną turystykę wirtualną – Seoul World Model pokazuje, że przyszłość AI leży w ścisłym połączeniu z rzeczywistością, a nie tylko w sprawnej symulacji marzeń sennych algorytmów.
