Agenci AIGen AIR & D

Przełom DeepMind: Genie 3 jako klucz do ogólnej sztucznej inteligencji?

Google DeepMind, laboratorium badawcze stojące za przełomowymi osiągnięciami w dziedzinie sztucznej inteligencji, ujawniło Genie 3 – innowacyjny model świata, który może okazać się milowym krokiem na drodze do stworzenia ogólnej sztucznej inteligencji (AGI). Osiągnięcie AGI, czyli AI dorównującej ludzkim zdolnościom poznawczym, jest długoterminowym celem wielu badaczy.

„Genie 3 to pierwszy interaktywny model świata ogólnego przeznaczenia działający w czasie rzeczywistym”, powiedział Shlomi Fruchter, dyrektor ds. badań w DeepMind, podczas konferencji prasowej. Podkreślił, że model wykracza poza wąskie zastosowania swoich poprzedników, nie będąc przypisanym do konkretnego środowiska. Potrafi generować zarówno fotorealistyczne, jak i całkowicie fikcyjne światy, oraz wszystko pomiędzy.

Genie 3, będący jeszcze w fazie testów i niedostępny publicznie, czerpie z doświadczeń swojego poprzednika, Genie 2, który umożliwiał generowanie nowych środowisk dla agentów. Wykorzystuje również elementy najnowszego modelu DeepMind do generowania wideo, Veo 3, który wykazuje głębokie zrozumienie fizyki. Dzięki prostemu poleceniu tekstowemu, Genie 3 jest w stanie wygenerować kilkuminutowe, różnorodne i interaktywne środowiska 3D w rozdzielczości 720p przy 24 klatkach na sekundę. To znaczący skok w porównaniu do Genie 2, który ograniczał się do 10-20 sekund. Nowością są również „zdarzenia świata wywoływane podpowiedzią”, pozwalające na dynamiczną zmianę generowanego środowiska.

Jednym z najbardziej intrygujących aspektów Genie 3 jest jego zdolność do utrzymywania fizycznej spójności symulacji w czasie. Model „zapamiętuje” to, co wygenerował wcześniej – zdolność, która nie została explicite zaprogramowana przez badaczy, lecz wyłoniła się w trakcie jego działania. Fruchter zaznaczył, że choć Genie 3 ma oczywiste zastosowania w edukacji i nowych mediach generatywnych, takich jak gry czy prototypowanie, jego prawdziwy potencjał ujawni się w trenowaniu agentów do zadań ogólnego przeznaczenia – co jest kluczowe w dążeniu do AGI.

„Uważamy, że modele świata są kluczowe na drodze do AGI, zwłaszcza dla agentów wcielonych, gdzie symulowanie scenariuszy z prawdziwego świata jest szczególnie trudne”, dodał Jack Parker-Holder, naukowiec z zespołu DeepMind ds. otwartych systemów. Genie 3 ma za zadanie rozwiązać to wąskie gardło. Podobnie jak Veo, nie opiera się na sztywno zakodowanym silniku fizycznym. Zamiast tego, samodzielnie uczy się, jak działa świat – jak poruszają się, upadają i oddziałują obiekty – poprzez zapamiętywanie wygenerowanych treści i wnioskowanie w długich horyzontach czasowych. „Model jest autoregresyjny, co oznacza, że generuje jedną klatkę na raz”, wyjaśnił Fruchter. „Musi spojrzeć wstecz na to, co zostało wygenerowane wcześniej, aby zdecydować, co wydarzy się dalej. To kluczowy element architektury”.

Ta „pamięć” świata stwarza spójność w jego symulacjach, a spójność ta pozwala mu rozwijać swego rodzaju intuicyjne poczucie fizyki. Jest to podobne do tego, jak ludzie rozumieją, że szklanka stojąca na krawędzi stołu zaraz spadnie, lub że powinni schylić się, aby uniknąć spadającego przedmiotu. Ta zdolność do symulowania spójnych, fizycznie wiarygodnych środowisk w czasie sprawia, że Genie 3 jest znacznie więcej niż tylko modelem generatywnym. Staje się idealnym poligonem treningowym dla agentów ogólnego przeznaczenia.

Nie tylko może generować nieskończone, różnorodne światy do eksploracji, ale ma również potencjał, aby doprowadzić agentów do ich granic – zmuszając ich do adaptacji, borykania się z problemami i uczenia się na własnych doświadczeniach w sposób, który odzwierciedla to, jak ludzie uczą się w świecie rzeczywistym. Obecnie zakres działań, jakie agent może podjąć, jest nadal ograniczony. Na przykład, zdarzenia świata wywoływane podpowiedzią pozwalają na szeroki zakres interwencji środowiskowych, ale niekoniecznie są wykonywane przez samego agenta. Podobnie, nadal trudno jest dokładnie modelować złożone interakcje między wieloma niezależnymi agentami we wspólnym środowisku. Genie 3 może również obsługiwać tylko kilka minut ciągłej interakcji, podczas gdy do właściwego szkolenia potrzebne byłyby godziny.

Mimo tych ograniczeń, Genie 3 stanowi istotny krok naprzód w nauczaniu agentów, aby wykraczali poza reagowanie na dane wejściowe – mogli planować, eksplorować, szukać niepewności i ulepszać się poprzez próby i błędy. To rodzaj samodzielnego, ucieleśnionego uczenia się, które jest kluczowe w dążeniu do ogólnej inteligencji.

„Nie mieliśmy jeszcze momentu 'ruchu 37′ dla agentów wcielonych, gdzie mogliby faktycznie podejmować nowatorskie działania w świecie rzeczywistym”, powiedział Parker-Holder, nawiązując do legendarnego momentu z 2016 roku w grze Go między agentem AI DeepMind AlphaGo a mistrzem świata Lee Sedolem, w której AlphaGo wykonało niekonwencjonalny i błyskotliwy ruch, który stał się symbolem zdolności AI do odkrywania nowych strategii poza ludzkim rozumieniem. „Ale teraz, potencjalnie możemy zapoczątkować nową erę”, podsumował.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *