Modele fizyczne

JEPA-Anything: uniwersalny model świata z obiecującymi, ale nierównymi wynikami

Modele świata tworzy się zazwyczaj z myślą o konkretnych zastosowaniach: od sterowania robotami po analizę danych biologicznych. Zespół prowadzony przez PhAI Labs, we współpracy z badaczami ze Stanfordu, Oksfordu i Princeton, przetestował inne podejście. W pracy poświęconej modelowi JEPA-Anything sprawdzono jedną architekturę w siedmiu odmiennych dziedzinach, od dynamiki płynów po dane kliniczne.

Model bazuje na koncepcji JEPA (Joint Embedding Predictive Architecture), która zamiast odtwarzać surowe dane, na przykład każdy piksel obrazu, przewiduje abstrakcyjną reprezentację przyszłego lub brakującego stanu. W standardowym wydaniu prognoza sprowadza się jednak do pojedynczego wektora cech, co sprzyja dominacji łatwiejszych do wychwycenia wzorców nad trudniejszymi. W JEPA-Anything przewidywany stan rozbito na cztery części obsługiwane przez osobne moduły. Autorzy nie przypisują im z góry konkretnych ról — różne aspekty danych mają wyłaniać się w trakcie treningu.

Przewaga w fizyce, ograniczenia w robotyce

Zespół zestawił JEPA-Anything ze standardowym modelem JEPA o identycznej architekturze, trenowanym na tych samych danych i w takich samych warunkach. Wyniki różniły się zależnie od charakteru zadania:

  • Układy dynamiczne i fizyka: w uproszczonym teście gry Pong błąd przewidywania spadł o 35 proc. względem modelu bazowego, a przy kombinacjach interwencji niewidzianych w treningu — o 13 proc. W symulacji równania Burgersa, używanego w dynamice płynów, błąd był niemal o połowę niższy, a przy horyzoncie 50 kroków przewaga wyniosła około 3 proc.
  • Dynamika molekularna: model utrzymał lepsze wyniki w symulacjach cząsteczkowych wody, kwarcu, paracetamolu i benzenu przy prognozowaniu do 100 kroków.
  • Robotyka i obraz: w planowaniu ruchu trójwymiarowych maszyn kroczących nowy wariant okazał się lepszy w dwóch z trzech środowisk, a w jednym przegrał ze standardowym JEPA. W zadaniach opartych bezpośrednio na pikselach różnica między modelami była niewielka.

Wskazówka biologiczna, nie gotowa terapia

Najbardziej namacalnym elementem badania było wykorzystanie modelu do wygenerowania hipotezy biologicznej dotyczącej raka wątroby. Analizując wyuczone reprezentacje danych o aktywności genów, poziomach białek i profilach CRISPR, model wskazał połączenie interleukiny 18 (IL-18, cząsteczki aktywującej komórki odpornościowe) z blokadą enzymu CD73, który w mikrośrodowisku guza osłabia odpowiedź immunologiczną.

Hipotezę sprawdzono eksperymentalnie na komórkach nowotworowych hodowanych z komórkami odpornościowymi, organoidach, fragmentach tkanek guza pobranych od trzech pacjentów oraz na myszach. W próbach na organoidach i fragmentach tkanek połączenie IL-18 z inhibitorem CD73 prowadziło do obumarcia większej liczby komórek nowotworowych niż każdy ze składników podany osobno. Choć wynik ten stanowi punkt wyjścia do dalszych prac przedklinicznych, nie jest dowodem na skuteczność metody u ludzi ani gotowym schematem leczenia.

Autorzy wykazali również, że model trenowany na symulacjach orbit odtworzył zależność zbliżoną do trzeciego prawa Keplera (wykładnik wyniósł -1,4991 wobec teoretycznego -1,5). Był to jednak wynik uzyskany w pojedynczym treningu, z którego wybrano przebieg o najniższym błędzie. Badacze zaznaczają także, że sam podział reprezentacji na cztery składowe nie oznacza automatycznie, że model bezbłędnie izoluje rzeczywiste zależności przyczynowo-skutkowe.