Masked Visual Actions: управление world model через пиксели

Masked Visual Actions: управление world model через пиксели

Первичный источник

Masked Visual Actions for Unified World Modeling, Hadi Alzayer, Wenlong Huang, Haonan Chen и ещё восемь авторов, arXiv:2607.19343, 21 июля 2026 года. У проекта есть отдельная страница и репозиторий с кодом.

Видео world model удобно обучать в визуальном пространстве, но роботу нужно сообщить действие. Masked Visual Actions предлагает делать это без отдельного универсального action vocabulary: действием становится частично открытая траектория сущности внутри видео.

Если открыть движение робота, модель работает как forward model и предсказывает реакцию сцены. Если открыть желаемое движение объекта, та же модель генерирует движение робота, согласованное с этим исходом. Для преобразования полученного движения в низкоуровневые команды всё равно нужен inverse dynamics model.

Что именно подаётся на вход

Модель получает исходный кадр, control video с визуализацией траектории и текстовое описание. В опубликованном коде используется LoRA поверх Wan2.2-Fun-A14B-Control. Репозиторий содержит inference-скрипт, training recipe и веса.

При подготовке данных авторы используют два способа получить visual action:

  • сегментацию робота в записанном видео;
  • рендеринг URDF по сохранённым joint states и параметрам камеры.

Второй вариант позволяет задавать на inference новую траекторию, не имея готовой маски из реального ролика.

Что показано в экспериментах

Проверка Что сообщают авторы
Объём fine-tuning данных 15 часов masked-примеров из реального видео и симуляции
Forward modeling воображаемые rollout согласуются с исходами реальных выполнений и помогают ранжировать кандидатов
Inverse modeling желаемое движение объекта используется для синтеза подходящего движения робота
Real-world демонстрации на странице проекта опубликованы 80 запусков по четырём задачам
Generalization показаны роботы и объекты, отсутствовавшие в training-распределении

Эксперименты относятся к world model. Они не доказывают, что видео-модель может полностью заменить кинематику, планировщик или safety layer реального робота. Заголовок предыдущей версии обещал больше, чем демонстрирует paper.

Ограничения

Авторы показывают failure cases для тонких точных взаимодействий: возможны неестественные контакты и артефакты в областях, не видимых на исходном кадре. Кроме того:

  • визуально правдоподобный rollout не гарантирует физическую и безопасную исполнимость;
  • в основе лежит крупная 14B video model, поэтому inference требует CUDA GPU;
  • для реального управления остаётся задача преобразования видео в действия приводов;
  • 15 часов fine-tuning данных не означают, что базовая модель обучена только на 15 часах видео;
  • сравнение на выбранных сценах не доказывает универсальную переносимость на любые роботы.

Практический вывод

Одна форма conditioning поддерживает forward simulation, planning, policy evaluation и inverse modeling. В этом и состоит практический результат работы. Называть метод «заменой физики» было бы неточно: это визуальный интерфейс для world model.

Продолжить тему можно в материалах о слепоте video-LLM к движению, саморазвивающихся world models, адаптации робота к контексту и галлюцинациях world model.

Что проверено редакцией: сведения сопоставлены с arXiv, project page и GitHub. Код и робототехнические эксперименты локально не воспроизводились.

← Все записи