Reka AI prezentuje Rho-1. Jeden model do tekstu, wideo i sterowania robotem
Reka AI udostępniła wersję badawczą (research preview) modelu Rho-1, liczącego 19 miliardów parametrów. System został zaprojektowany tak, aby przetwarzać tekst, obrazy i wideo oraz generować akcje sterujące robotem w ramach jednej sieci neuronowej i wspólnego kontekstu.
W przeciwieństwie do architektur, które rozdzielają zadania pomiędzy wyspecjalizowane podmodele lub zewnętrzne narzędzia, Rho-1 zapisuje wszystkie typy danych jako tokeny w jednej przestrzeni. Zgodnie z opisem firmy te same wagi sieci odpowiadają zarówno za przewidywanie kolejnych klatek obrazu z kamery, jak i za generowanie sygnałów kontrolnych dla ruchów robota.
Istotną przeszkodą w trenowaniu modeli robotycznych pozostaje ograniczona dostępność danych telemetrycznych z fizycznych urządzeń. Reka AI próbuje rozwiązać ten problem za pomocą modelu odwrotnej dynamiki, którego zadaniem jest wydobywanie sygnałów sterujących ze zwykłych filmów wideo dostępnych w internecie. Trening bazowej wersji Rho-1 trwał około trzech miesięcy i został przeprowadzony na klastrze 320 procesorów graficznych Nvidia H100.
Firma rozwijała wcześniej multimodalne modele z rodziny Reka Core. Rho-1 stanowi rozwinięcie tych prac w stronę systemów podejmujących decyzje w fizycznym otoczeniu. Twórcy udostępnili model jako podgląd badawczy — publikacja nie zawiera jeszcze szczegółowych wyników testów ani ocen skuteczności sterowania w rzeczywistych warunkach robotycznych.
