Развитие Physical AI сегодня уткнулось в отсутствие достаточного количества данных. Если для обучения VLM мы могли взять огромный объем текстовой информации, который годами копился в интернете, то VLA и world‑action-модели кормить практически нечем, создавать новые датасеты для обучения этих моделей оказалось чуть ли не сложнее, чем разработать конструкцию робота. Хотя люди сняли и выложили в открытый доступ огромное количество видео от первого лица, где руками делают что угодно — готовят, собирают, крутят, хватают, но использовать их в таком виде пока невозможно.

Я Артём Лыков, руководитель R&D-направления Physical AI в MWS, и сегодня я расскажу вам о том, с какими проблемами сталкивается отрасль, и о том, как мы разработали и протестировали AgenticFocus — пайплайн, который берет любое FPV-видео и превращает его в полноценный датасет для обучения гуманоидных роботов тонкой моторике. Ключевая идея AgenticFocus — разделить видеоряд на несколько полноценных слоев информации — фон, объекты и кинематику конкретного робота.

Почему бы просто не взять для обучения готовое видео?

Для развития и обучения Physical AI требуется огромное количество качественных размеченных данных. Для Vision‑Language‑Action (VLA) и world‑action-моделей вероятность успешного обучения упирается в доступ к большим объемам визуальных и двигательных данных. VLA скрещивает зрение, язык и действия, а world‑action добавляют сюда еще и модель мира, предсказывающую реакции среды. Все это необходимо для того, чтобы робот мог видеть сцену и на основе этого решать, как на нее реагировать.

Использовать FPV-видео человека для обучения роботов в «сыром» виде не получится, существует ряд основных проблем.

Несовпадение ракурсов. У человека камера обычно закреплена на голове или груди, а у робота сенсоры привязаны к его собственной системе координат. То, что видит человек, и данные, которые получает с сенсоров робот, совместить довольно сложно. 

Потеря информации из-за перекрытий объектов. Во время манипуляций рука человека постоянно перекрывает объект, причем именно в тех зонах контакта, где геометрия и границы объекта критически важны для взаимодействия. Руки и пальцы человека в процессе взаимодействия с объектами постоянно перекрывают часть или весь объект, и модель просто не может получить информацию о том, как именно происходит взаимодействие. При этом существующие методы удаления человека из кадра или генеративного заполнения искажают информацию около объекта, которая нужнее всего.

Отсутствие прямой привязки к действиям робота. Даже если мы получили синхронизированное видео с движениями, это еще не гарантия, что данные согласованы с кинематикой и динамикой конкретного железа. А без такой привязки (embodiment‑consistent) обучать политике бессмысленно — робот просто не сможет повторить увиденное.

Кроме этого, существующие пайплайны обработки таких видео от первого лица либо слишком упрощают движения, либо требуют много времени для доработки и сложного оборудования для захвата движений.

AgenticFocus: наш рецепт превращения FPV-видео в датасет для гуманоидов

Для того чтобы решить эти проблемы, мы разработали подход AgenticFocus — пайплайн, который скрещивает реальное FPV-видео с виртуальной робототехнической сценой. Подготовка human‑to‑humanoid-датасета — это, по сути, построение видео «смешанной реальности». Ключевая идея — разделить сцену на объекты, их положение в пространстве и кинематику робота, а потом снова склеить в полноценный обучающий датасет.

Восстановление информации об объекте с акцентом на его геометрию и внешний вид (object‑centric restoration). Первым делом метод находит и отслеживает объект взаимодействия. Затем он удаляет человека из кадра, после чего восстанавливает объекты, перекрытые рукой или другими элементами сцены, чтобы модель воспринимала объект целостно. Для этого объекты, значимые для выполнения поставленной задачи, идентифицируются по всем кадрам и восстанавливаются их эталонные модели — полная геометрия, собранная по нескольким кадрам после удаления человека. Так у нас появляется цельная 3D-модель объекта, с которым происходит взаимодействие.

Перенос полного движения кисти в системе координат камеры (camera‑relative full‑hand retargeting). После того как метод выделил и восстановил объекты, мы реконструируем полную траекторию движения кистей, то есть пересчитываем траектории движения человеческой кисти в кинематику робота. При этом мы задаем координаты движений относительно системы координат камеры, а не базы робота. Это сильно упрощает выравнивание и согласует демонстрацию с виртуальной точкой зрения робота. Человеческие руки заменяются на роботизированные манипуляторы, максимально похожие на человеческие кисти, то есть на руки целевого гуманоида, которого мы собираемся обучать, а траектории действий и состояний робота рассчитываются и переводятся в полноценный формат данных о движении координат всех узлов. Полученные траектории запястья и пальцев мы сглаживаем, чтобы убрать шум распознавания, чтобы робот двигался плавно. Дополнительно применяем фиксированные коррекции ориентации запястья: постоянные поправки, компенсирующие разницу в геометрии крепления кисти робота по сравнению с ориентацией ладони человека, восстановленной из видео. Потому что у робота суставы могут быть чуть иначе расположены, и это надо учесть. На выходе этого этапа мы получаем синхронизированное action‑state‑представление — связку действий робота (команды моторам) с состояниями (положение, скорость, усилия) в каждый момент времени. Траектории рук, команды пальцам и состояния робота — всё в camera‑relative-координатах. Теперь у нас есть и объекты, и движения. Осталось собрать это в единую картину.

Многослойный композитинг. После обработки объектов и движений робота формируется синтезированное видео смешанной реальности , где исходное видео совмещено с полноценными моделями объектов и виртуальным роботом, повторяющим движения человека, то есть мы собираем итоговый датасет через многослойный рендеринг — объекты, движения виртуального робота и фон накладываются друг на друга с учетом глубины, что также очень важно: именно глубина обеспечивает реалистичное перекрытие между манипулируемыми объектами и пальцами робота в зонах контакта и позволяет избежать появления случайных артефактов, которые нейросеть потом будет пытаться осмыслить. На выходе мы получаем синхронизированный набор данных, где FPV-картинка жестко привязана к действиям робота, его состояниям и ориентации относительно системы координат камеры. Чтобы сохранить локальные сигналы глубины в зоне контакта, мы рендерим робота раздельными слоями: отдельно вся сочлененная рука (full articulated‑hand) и отдельно слой большого пальца вблизи контакта (near‑contact thumb pass). Затем восстановленный шаблон объекта компонуется вокруг этих рендеров так, чтобы объект мог перекрывать соответствующие области пальцев, но при этом видимый контакт большого пальца сохранялся там, где требуется захват. Такая стратегия дает гораздо более правдоподобную структуру взаимодействия, чем единый оверлей переднего плана, особенно для небольших объектов и обхватывающих захватов.

Как мы оценивали AgenticFocus на точность и плавность

Для оценки мы собрали тестовые последовательности из FPV-видео человека — использовали как клипы из общедоступного датасета EPIC‑KITCHENS (кухонные эгоцентрические видео), так и наши внутренние обработанные демонстрации. Все видео привели к единой частоте 30 FPS.

Мы сравнили AgenticFocus с Masquerade и Do as I Do в рамках одного и того же протокола оценки. Перед сравнением все траектории привели к общей нормализованной временной шкале и единой системе координат, чтобы мы могли сравнивать все показатели, приведенные к одной шкале.

Точность траекторий

Метрика. Для оценки точности мы вычисляем среднюю ошибку положения между эталонной траекторией и восстановленной траекторией, полученной каждым методом.

Результаты. AgenticFocus демонстрирует наименьшую ошибку реконструкции среди сравниваемых методов — это означает, что его траектории ближе всего к эталонным. Такой результат подтверждает, что camera‑relative alignment (согласование в системе координат камеры, а не базы робота) в сочетании с full‑hand retargeting (переносом полного движения всей кисти, включая пальцы) заметно уменьшает пространственное несоответствие, по сравнению с существующими пайплайнами кросс-воплощенческого переноса. Напомним: меньшее значение ошибки — лучше. И здесь наш подход уверенно впереди.

Плавность движений по методике SPARC

Метрика. Чтобы оценить, насколько плавно робот повторяет движения человека, мы используем метрику SPARC (Spectral Arc Length). Она анализирует частотный состав профиля скорости запястья робота, и работает это так: чем меньше значение SPARC — тем плавнее траектория. Отрицательные значения — это норма, и чем они ближе к нулю, тем лучше.

Результаты. AgenticFocus стабильно демонстрирует наименее отрицательные значения на протяжении всей выборки, то есть движения запястья получаются более плавными и когерентными после ретаргетинга, по сравнению с обоими бенчмарками.

AgenticFocus выходит на –5,18, тогда как у Masquerade –5,56, а у Do as I Do –6,05. Если пересчитать в проценты, то относительно Masquerade мы улучшаем абсолютное значение SPARC примерно на 7%, а относительно Do as I Do — почти на 14%. Что это значит? Camera‑relative-ретаргетинг в связке с целенаправленным сглаживанием траекторий реально дает ощутимый прирост в качестве движений запястья гуманоидного робота.

AgenticFocus как мост между видео и обучением роботов

Конечный результат AgenticFocus — это датасет, где каждому визуальному наблюдению соответствует синхронизированное действие и состояние робота. Сфокусированная визуальная последовательность, в которой человеческие руки заменены руками гуманоидного робота, а реальные объекты задачи сохранены. Теперь на основе такого датасета можно обучать модели.

AgenticFocus позволяет быстро и без особых усилий преобразовывать любое видео от первого лица в датасет, подходящий для обучения гуманоидного робота. Благодаря простой переработке обычных видео от первого лица AgenticFocus серьезно снижает порог входа для обучения гуманоидных роботов. Главный бонус: AgenticFocus не требует дорогих motion‑capture-систем, перчаток с датчиками и прочего дополнительного дорогого оборудования. И если говорить совсем просто: мы сделали шаг к тому, чтобы у каждого исследователя и инженера была возможность обучать гуманоидных роботов без бюджета космического корабля. Потенциал огромный, и мы только в начале пути.

А если вам интересно более углубленно погрузиться в технические детали, формулы и сложные термины, вы можете изучить полный текст научной статьи, которую мы презентуем по этой теме на ISMAR 2026 — конференции уровня A* в области смешанной и дополненной реальности: AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning.