Google DeepMind prezentuje Dream-RSI: AI uczy się efektywnej eksploracji dzięki odtwarzaniom
Samodoskonalące się systemy AI, które projektują algorytmy lub optymalizują kod, opierają się zazwyczaj na kosztownej metodzie prób i błędów. Zespół badaczy z Google DeepMind zaproponował rozwiązanie, które pozwala radykalnie zmniejszyć liczbę niezbędnych operacji. Metoda Dream-RSI, opisana w pracy opublikowanej 14 września 2026 roku i udostępnionej w formie preprintu (arXiv:2609.14858), wprowadza mechanizm „odtwarzania” historii poszukiwań do ewaluacji nowych strategii eksploracji bez konieczności ponownego wywoływania modelu językowego. Pełna nazwa nowo zaprezentowanego frameworku to Recursive Self-Improvement through Evolving Worlds, co podkreśla jego rolę w skalowalnym i rekurencyjnym samodoskonaleniu systemów AI. Za opracowanie metody odpowiada zespół złożony z 17 autorów reprezentujących Google, Google DeepMind, University of Maryland oraz University of Virginia.
Nauka na mapie zamiast błądzenia w terenie
Kluczową innowacją Dream-RSI jest wykorzystanie zapisanych drzew przeszukiwań do testowania alternatywnych polityk agenta w trybie offline. Zamiast za każdym razem generować nowe rozwiązania, system analizuje zgromadzone dane i sprawdza, co by się stało, gdyby agent inaczej rozłożył priorytety lub wcześniej porzucił dany kierunek badań. Proces ten odbywa się naprzemiennie: po fazie rzeczywistych prób (live runs) następuje faza „odtwarzania”, w której agent testuje tysiące wariantów strategii na posiadanych już wynikach.
Badania przeprowadzone z wykorzystaniem modeli Gemini 3.1 Pro i Gemini 3.7 Flash na ośmiu zróżnicowanych zadaniach, które objęły trzy główne obszary: optymalizację matematyczną, optymalizację kodu statystycznego oraz optymalizację kerneli GPU, wykazały ogromną przewagę wydajnościową:
- W jednym z testów optymalizacji kodu Dream-RSI osiągnął wyznaczony cel przy zaledwie 317 próbach, podczas gdy konkurencyjny system SimpleTES potrzebował ich aż 51 200.
- W zadaniach optymalizacji kerneli GPU metoda pozwoliła na uzyskanie do 2,43-krotnego zmniejszenia liczby generacji przy zachowaniu tego samego wyniku końcowego.
- W testach kodu statystycznego średni czas wykonania (runtime) spadł z 3 587 ms do 2 931 ms. Warto odnotować, że programy wygenerowane przez system okazały się szybsze niż uznane rozwiązania sklearn oraz glmnet na wszystkich testowanych zbiorach danych, co potwierdza uniwersalność wypracowanych optymalizacji.
Pułapka zbyt precyzyjnych instrukcji
Analiza przeprowadzona przez badaczy DeepMind dostarcza również istotnych wniosków na temat tego, jak kierować pracą agentów AI. Okazało się, że próby kondensowania historii poszukiwań w formie konkretnych instrukcji tekstowych dla modelu mogą przynieść skutek odwrotny do zamierzonego. W zadaniach otwartych zbyt szczegółowe wytyczne potrafią zawęzić pole eksploracji i zablokować agentowi możliwość odkrycia bardziej kreatywnych rozwiązań, co ostatecznie pogarsza wyniki.
Dream-RSI wpisuje się w szerszy trend rekurencyjnego samodoskonalenia, obok projektów takich jak AlphaEvolve czy Hyperagents. Różni się jednak od nich tym, że nie modyfikuje wag samego modelu bazowego, a jedynie optymalizuje sposób, w jaki agent zarządza procesem poszukiwań. Udostępniony w serwisie GitHub framework pokazuje, że kluczem do zaawansowanych systemów AI może być nie tylko większa moc obliczeniowa, ale przede wszystkim sprawniejsze wykorzystanie już raz wygenerowanych danych.
