Команда Oppo Multi-X представила X-OmniClaw — open-source ИИ-агент для Android, который использует камеру, экран и голос и выполняет задачи в реальных приложениях без запуска через облачную копию смартфона.
В техническом отчёте AI Center компании Oppo противопоставляет этот подход облачным платформам вроде RedFinger, Wuying от Alibaba и Tencent Cloud Phone. Такие сервисы запускают агентов в виртуальных Android-средах в дата-центре, поэтому у них нет прямого доступа к локальным сенсорам, камерам и приватным данным устройства.
X-OmniClaw работает прямо на физическом Android-устройстве. По данным отчёта, модули восприятия, управления и взаимодействия с приложениями находятся на самом смартфоне. Облачная языковая модель подключается только при необходимости для задач более высокого уровня. Конкретные локальные модели в документе не названы, но упомянуты on-device grounding model и OCR для поиска элементов интерфейса, по которым можно нажать.
Агент объединяет три канала восприятия в один процесс. Сначала vision-language model анализирует сцену и запрос пользователя, а затем запускает нужное действие.
В одном из примеров пользователь спрашивает: «Сколько это стоит на Taobao?», направляя камеру на товар. Система сначала переформулирует запрос во внутренний структурированный вид — «цена Evian spray на Taobao» — и только после этого передаёт его на выполнение.
Для долгосрочной памяти X-OmniClaw сжимает локальные данные в семантические записи. В фоновом режиме фотографии из галереи преобразуются в короткие описания объектов, сцен и событий, после чего сохраняются в Markdown-файл.
Каждая запись проходит через фильтр, который убирает чувствительную информацию перед сохранением. В отчёте отмечены риски отправки данных в облачные системы компьютерного зрения. Следующий шаг — перенос таких задач на локальные модели, чтобы исходные изображения не покидали устройство.
Вместо построения каждого сценария с нуля агент превращает действия пользователя в повторно используемые навыки. Он извлекает полную команду запуска страницы приложения и в следующий раз открывает её напрямую через deeplink, не повторяя исходную цепочку нажатий.
Если это не срабатывает, система по очереди переходит к более простым способам запуска. Для поиска интерактивных элементов X-OmniClaw сочетает XML-структуру интерфейса, grounding model и распознавание текста. Это помогает в интерфейсах с большим количеством рекламы, где одного XML недостаточно, чтобы точно определить цель нажатия.
В первом сценарии пользователь наводит камеру на товар и спрашивает о цене. Агент открывает приложение магазина, прокручивает экран, делает скриншоты и с помощью vision-language model озвучивает цены и показатели продаж. После этого команда «открой второй товар» выполняется без дополнительного уточнения.
Во втором примере X-OmniClaw работает как ScreenAvatar — «цифровой суррогат», который по команде выполняет экранные задачи, например последовательно решает серию учебных упражнений.
Третья демонстрация показывает обработку запроса на создание подборки из всех фото попугаев. Система находит подходящие файлы, через deeplink открывает инструмент автоматического монтажа в приложении для редактирования видео и выбирает изображения с помощью множественных нажатий.
В четвёртом примере пользователь один раз сохраняет путь к глубоко спрятанной странице со скидками. В следующий раз достаточно голосовой команды, чтобы снова открыть тот же подраздел, даже если у приложения нет публичных deeplink.
Проект основан на open-source кодовой базе HermesApp и занимает место между OpenClaw, который больше сосредоточен на ПК, и Hermes Agent от Nous Research, где упор сделан на эмерджентные способности. Код и связанные материалы опубликованы на GitHub.
Ранее Google показала на примере Gemma 4, что полностью локальная модель на смартфоне уже может работать как агент. В демонстрационном приложении Google AI Edge Gallery модель запрашивает данные из Wikipedia, создаёт QR-коды и открывает трекеры настроения с графиками.
С точки зрения метода X-OmniClaw опирается на UI-TARS от ByteDance — визуального GUI-агента, который использует только скриншоты и координаты. Решение Oppo дополняет этот подход структурными XML-данными и выполнением на самом устройстве, чтобы снизить число ошибок, которые возникают у чисто визуальных систем в динамических интерфейсах.
Источник: The Decoder, технический отчёт Oppo, GitHub.






















