Robotyka

Robot uczy się jak człowiek. Model GEN-1.5 potrzebuje tylko 12 sekund nagrania

Pokaż robotowi, jak odkręcić słoik, a on powtórzy to niemal natychmiast. Startup Generalist AI udowadnia, że era wielomiesięcznych treningów w symulatorach może dobiegać końca. Ich najnowszy model, GEN-1.5, potrafi opanować nową czynność na podstawie pojedynczego, kilkusekundowego nagrania wideo. To przejście od sztywnego programowania do mechanizmu, który twórcy nazywają fizycznym promptem.

Dlaczego to ważne właśnie teraz

Obecnie największą barierą w robotyce nie jest sam sprzęt, ale czas potrzebny na nauczenie go konkretnych ruchów. Przełom polega na tym, że GEN-1.5 wykorzystuje tzw. in-context learning, czyli naukę w obrębie okna kontekstowego modelu. Według oficjalnego wpisu na blogu Generalist AI, system „potrafi nauczyć się nowego zadania z zaledwie 12 sekund danych demonstracyjnych”, co drastycznie skraca czas wdrożenia maszyn w nowych środowiskach.

Mechanizm fizycznego promptu w robotyce

Zamiast żmudnego pisania kodu czy setek godzin symulacji, inżynierowie wykorzystują wideo trwające od 3 do 12 sekund. Materiał trafia do pamięci krótkotrwałej modelu, a robot – bez żadnej aktualizacji wag sieci ani fine-tuningu – przystępuje do pracy. To radykalna zmiana: maszyna nie musi już „ćwiczyć” danej czynności tysiące razy, aby zrozumieć jej sens.

Od otwierania słoików po imitację ludzkich dłoni

Jak to wygląda w praktyce? Skuteczność modelu w testach „na surowo” wynosi obecnie średnio 59 procent przy zadaniach takich jak wyjmowanie banknotów z portfela czy manipulacja przedmiotami kuchennymi. Jak zauważa magazyn WIRED, robot jest w stanie ukończyć pokazane mu zadanie średnio w niewiele ponad połowie przypadków. Wynik ten, choć daleki od perfekcji, dotyczy pierwszej próby. Wystarczy jednak dodać około 5 minut dodatkowych danych i wykonać 10 kroków optymalizacji, aby wskaźnik sukcesu podskoczył do 83 procent. Model potrafi też łączyć prompty w sekwencje i przenosić wiedzę z cyfrowych symulacji na fizyczne siłowniki.

Zdolności emergentne czy marketingowy optymizm?

Przedstawiciele Generalist AI podkreślają, że funkcja uczenia się z kontekstu pojawiła się w modelu samoistnie jako cecha emergentna. Stało się to po ośmiu miesiącach intensywnego pretreningu na masowych zbiorach danych interakcyjnych. Choć GEN-1.5 radzi sobie z szerokim spektrum zadań, warto zachować chłodną głowę. Prezentowane operacje są wciąż stosunkowo proste, a wszystkie dane pochodzą bezpośrednio od producenta. Zanim roboty zaczną masowo wyręczać nas w domu, model musi przejść niezależną weryfikację w bardziej chaotycznych warunkach niż sterylne laboratorium.