Masked Visual Actions: управление world model через пиксели
Masked Visual Actions for Unified World Modeling, Hadi Alzayer, Wenlong Huang, Haonan Chen и ещё восемь авторов, arXiv:2607.19343, 21 июля 2026 года. У проекта есть отдельная страница и репозиторий с кодом.
Видео world model удобно обучать в визуальном пространстве, но роботу нужно сообщить действие. Masked Visual Actions предлагает делать это без отдельного универсального action vocabulary: действием становится частично открытая траектория сущности внутри видео.
Если открыть движение робота, модель работает как forward model и предсказывает реакцию сцены. Если открыть желаемое движение объекта, та же модель генерирует движение робота, согласованное с этим исходом. Для преобразования полученного движения в низкоуровневые команды всё равно нужен inverse dynamics model.
Что именно подаётся на вход
Модель получает исходный кадр, control video с визуализацией траектории и текстовое описание. В опубликованном коде используется LoRA поверх Wan2.2-Fun-A14B-Control. Репозиторий содержит inference-скрипт, training recipe и веса.
При подготовке данных авторы используют два способа получить visual action:
- сегментацию робота в записанном видео;
- рендеринг URDF по сохранённым joint states и параметрам камеры.
Второй вариант позволяет задавать на inference новую траекторию, не имея готовой маски из реального ролика.
Что показано в экспериментах
| Проверка | Что сообщают авторы |
|---|---|
| Объём fine-tuning данных | 15 часов masked-примеров из реального видео и симуляции |
| Forward modeling | воображаемые rollout согласуются с исходами реальных выполнений и помогают ранжировать кандидатов |
| Inverse modeling | желаемое движение объекта используется для синтеза подходящего движения робота |
| Real-world демонстрации | на странице проекта опубликованы 80 запусков по четырём задачам |
| Generalization | показаны роботы и объекты, отсутствовавшие в training-распределении |
Эксперименты относятся к world model. Они не доказывают, что видео-модель может полностью заменить кинематику, планировщик или safety layer реального робота. Заголовок предыдущей версии обещал больше, чем демонстрирует paper.
Ограничения
Авторы показывают failure cases для тонких точных взаимодействий: возможны неестественные контакты и артефакты в областях, не видимых на исходном кадре. Кроме того:
- визуально правдоподобный rollout не гарантирует физическую и безопасную исполнимость;
- в основе лежит крупная 14B video model, поэтому inference требует CUDA GPU;
- для реального управления остаётся задача преобразования видео в действия приводов;
- 15 часов fine-tuning данных не означают, что базовая модель обучена только на 15 часах видео;
- сравнение на выбранных сценах не доказывает универсальную переносимость на любые роботы.
Практический вывод
Одна форма conditioning поддерживает forward simulation, planning, policy evaluation и inverse modeling. В этом и состоит практический результат работы. Называть метод «заменой физики» было бы неточно: это визуальный интерфейс для world model.
Продолжить тему можно в материалах о слепоте video-LLM к движению, саморазвивающихся world models, адаптации робота к контексту и галлюцинациях world model.
Что проверено редакцией: сведения сопоставлены с arXiv, project page и GitHub. Код и робототехнические эксперименты локально не воспроизводились.