Oppo udostępnia X-OmniClaw: agent AI, który przejmuje kontrolę nad smartfonem bez udziału chmury
Koniec z wirtualizacją: AI zamieszka bezpośrednio w Twoim telefonie
Wraz z premierą projektu X-OmniClaw, Oppo rzuca wyzwanie gigantom takim jak Alibaba czy Tencent. Podczas gdy konkurencja opiera swoje mobilne agenty na wirtualizacji w chmurze – co de facto oznacza uruchamianie systemu na zdalnych serwerach – inżynierowie z zespołu Multi-X postawili na podejście „on-device”. X-OmniClaw operuje bezpośrednio na fizycznym sprzęcie, co daje mu unikalną przewagę: pełny dostęp do sensorów urządzenia, kamery oraz ekranu w czasie rzeczywistym, bez konieczności przesyłania wrażliwych danych poza telefon.
Strategia Oppo wydaje się być odpowiedzią na rosnące obawy o prywatność. Zamiast tworzyć cyfrowego bliźniaka telefonu w centrum danych, logika percepcji i kontroli interfejsu pozostaje lokalna. Zasoby chmurowe, takie jak potężne modele językowe, są traktowane jedynie jako „paliwo” do zadań wymagających wysokiego poziomu rozumowania, podczas gdy operacyjna „brudna robota” odbywa się na procesorze smartfona.
Multimodalna percepcja i cyfrowe klonowanie nawyków
System opiera się na trzech kanałach percepcji: wzroku, mowie i analizie zawartości ekranu. W praktyce pozwala to na interakcje, które dotąd kojarzyły się z asystentami przyszłości. W zademonstrowanych przykładach użytkownik mógł skierować obiektyw kamery na przedmiot i zapytać o cenę, a agent samodzielnie otwierał aplikację zakupową, przewijał wyniki i odczytywał najkorzystniejsze oferty. Co istotne, X-OmniClaw nie jest ograniczony do sztywnych skryptów. Potrafi uczyć się „skrótów”, analizując zachowanie użytkownika. Zamiast za każdym razem przeklikiwać się przez zawiłe menu, agent ekstrahuje głębokie linki (deeplinks), pozwalając na natychmiastowe przeskoczenie do konkretnej podstrony wewnątrz aplikacji przy kolejnym poleceniu.
Pamięć semantyczna i inteligentna galeria
Jednym z najciekawszych rozwiązań w X-OmniClaw jest mechanizm budowania długotrwałej pamięci. W czasie bezczynności urządzenia system analizuje lokalną galerię zdjęć, przetwarzając obrazy na tekstowe opisy i zapisując je w formie kompaktowego pliku Markdown. Dzięki temu agent wie, co znajduje się na zdjęciach, bez konieczności ich ciągłego skanowania. Podczas testów pozwoliło to na automatyczne stworzenie albumu z papugami w zewnętrznej aplikacji edycyjnej – AI samo wyselekcjonowało odpowiednie pliki na podstawie zapytania głosowego i „przekazało” je do edytora za pomocą symulowanych kliknięć.
Precyzja w gąszczu interfejsów
Oppo udoskonaliło także sposób, w jaki AI „widzi” interfejs graficzny. Tradycyjne metody oparte wyłącznie na kodzie XML aplikacji często zawodzą w przypadku agresywnych reklam lub dynamicznych elementów, które przykrywają przyciski. X-OmniClaw łączy dane strukturalne z modelem wizualnym (grounding model) i rozpoznawaniem tekstu (OCR). To hybrydowe podejście, inspirowane m.in. modelem UI-TARS od ByteDance, drastycznie redukuje liczbę błędów w interpretacji tego, gdzie agent powinien „tapnąć”, aby wykonać polecenie użytkownika.
Projekt jest dostępny na platformie GitHub i bazuje na fundamentach takich jak HermesApp, stanowiąc brakujące ogniwo między agentami PC a rodzącymi się możliwościami modeli pokroju Gemma od Google. Choć Oppo wciąż dąży do pełnej eliminacji chmury z procesu decyzyjnego, X-OmniClaw już teraz pokazuje, że przyszłość asystentów mobilnych to nie tylko czatboty w przeglądarce, ale autonomiczni operatorzy systemu, działający w cieniu i szanujący naszą prywatność.
