Сегодня большинство впечатляющих демонстраций роботов показывают их действия в статической среде: предметы лежат на столе, освещение стабильно, камера направлена в рабочую зону, а сама сцена почти не меняется. В таких условиях современные VLA действительно показывают высокое качество управления.

Но реальные задачи для роботов в быту или на производстве намного сложнее. Как минимум — объекты движутся по конвейеру. И если с ними взаимодействует не закрепленный манипулятор, а полноростовой робот, ему придется делать шаги и поддерживать баланс тела дополнительными движениями. Все это многократно усложняет расчет движений.

Привет, Хабр! Меня зовут Дания, я ML-инженер в MTC Web Services. Мы в RnD-направлении Physical AI разрабатываем VLA (Vision-Language-Action) политику для гуманоида, который должен взаимодействовать не с аккуратно разложенными объектами на столе, а с предметами, которые двигаются во время выполнения действия.

В этом материале я хочу сосредоточиться на одной конкретной проблеме: почему робот уверенно берет предмет со стола, но начинает промахиваться, когда предмет едет по конвейеру. А еще расскажу, над чем мы сейчас работает у себя, чтобы научить гуманоида справляться с задачей в подобных условиях.

VLA: как робот связывает картинку, команду и действие

Современные VLA сочетают в себе обработку трех типов данных:

  • изображения сцены;

  • текстовых инструкций;

  • данных о текущем и желаемом положении конечностей (движении) робота.

Робот получает картинку сцены и команду вроде «возьми деталь», а модель помогает выбрать действие: куда вести кисть, что схватить, когда закрыть захват. 

По сути, VLA выступает в роли «мозга» робота. Она не управляет непосредственно моторами, а принимает решение о том, что именно нужно сделать. Затем это решение передается на нижние уровни, которые уже рассчитывают конкретные движения суставов, контролируют приводы и следят за безопасным выполнением команды, чтобы гуманоид не опрокинулся из-за потери контроля центра тяжести.

Одним из первых проектов, показавших возможности такого подхода, стала модель RT-2. Исследователи продемонстрировали, что большая модель vision-language способна использовать для управления роботом знания, полученные во время обучения на изображениях и текстах. 

Работ по VLA становится все больше, это направление активно развивается. Но как я говорила выше, большинство известных демо происходят в практически идеальных условиях: предметы лежат неподвижно, камера наблюдает рабочую область сверху, а робот может спокойно просчитывать действия столько времени, сколько нужно. Если первая попытка оказалась неточной, он может немного скорректировать движение и попробовать снова.

В условиях лаборатории этот сценарий хорошо воспроизводится, но реальный мир сложнее.

Почему брать предметы с конвейера сложнее, чем со стола

На первый взгляд задача выглядит похожей: в обоих случаях робот должен взять объект и перенести его в нужное место. Но между неподвижным предметом и тем, который движется, пусть и с постоянной скоростью по понятной траектории, существует принципиальная разница.

Когда предмет лежит неподвижно, время практически не играет роли. Робот может несколько раз посмотреть на него, поправить траекторию движения и повторить попытку захвата. 

В динамической среде на конвейере робот всегда получает информацию немного позже, чем она появилась в реальном мире. Поэтому в динамической задаче роботу нужно не просто понять, где объект находится сейчас, а предсказать, где он будет, когда рука сможет до него дотянуться.

Ошибки складываются из трех составляющих.

Задержка между наблюдением и действием

Любая робототехническая система работает с задержками. Изображение должно поступить с камеры, пройти предварительную обработку, затем модель формирует действие, после чего команда отправляется исполнительным механизмам.

Каждый из этих этапов занимает пусть небольшое, но ненулевое время. Для неподвижного объекта это почти незаметно. А вот для быстро движущейся детали даже несколько десятков миллисекунд могут означать, что точка захвата уже сместилась.

Последовательности действий устаревают

Большинство современных VLA формируют не одну команду, а небольшой блок последовательных действий — так называемый action chunk. Этот алгоритм подходит для выполнения статических задач: робот заранее знает, какие движения ему предстоит выполнить.

Однако в динамической среде заранее рассчитанная последовательность очень быстро перестает соответствовать реальности. Пока робот выполняет первые движения, объект продолжает перемещаться. Если система не обновляет план достаточно часто или не закладывает корректировку изначально, все ломается.

Именно поэтому в более свежих работах исследователи все чаще переходят к непрерывному обновлению действий по мере поступления новых наблюдений.

Есть только одна картинка

По одному кадру невозможно определить скорость объекта или направление его движения. Более того, роботу необходимо учитывать не только движение самой детали, но и собственную динамику.

Ему важно понимать:

  • где сейчас находится кисть;

  • сколько времени потребуется на выполнение движения;

  • насколько быстро он сам способен добраться до предполагаемой точки встречи с объектом.

Поэтому вместо обработки отдельных изображений в моделях начинают работать с последовательностями кадров. Так можно оценить траекторию движения объекта и выбрать момент будущего перехвата.

Одной из первых моделей такого рода стала DynamicVLA. Ее авторы показали, что основная причина промахов заключается не столько в качестве распознавания объектов, сколько в рассинхронизации между восприятием и действием в динамической манипуляции. Чтобы уменьшить этот эффект, авторы предлагают чаще обновлять действия и учитывать момент, к которому они относятся. 

Почему гуманоида сложнее запрограммировать, чем манипулятор

Большую часть исследований в области динамической манипуляции сегодня выполняют на стационарных роботах-манипуляторах. У них есть неподвижная база: если объект немного сместился, можно корректировать движение плечом, локтем и кистью.

У гуманоида движение руки влияет на положение корпуса и баланс. Иногда, чтобы перехватить объект, недостаточно вытянуть руку: нужно повернуть корпус, сместить таз, изменить стойку или сделать шаг. Если робот опоздал или промахнулся, ему важно не только повторить попытку, но и не потерять равновесие. Поэтому задача превращается в whole-body control: робот должен согласовать движение кисти, рук, корпуса, таза и ног.

При этом обязанности между уровнями управления разделяются. VLA отвечает за высокоуровневое понимание происходящего: определяет, что происходит в сцене и какое действие нужно выполнить, например какую деталь перехватить и в какую точку направить кисть. А за то, чтобы это действие было физически выполнимым, отвечают отдельные уровни управления, например whole-body controller: они учитывают кинематику робота, баланс, контакты стоп и ограничения суставов. Взаимодействие этих уровней позволяет гуманоиду не просто потянуться за объектом, а сделать это физически корректно и безопасно для самого робота.

Робот немного ошибся, но чтобы исправить промах, расчет придется начинать фактически с нуля. Изменилось положение корпуса, запас устойчивости уменьшился, а объект продолжает двигаться дальше. Поэтому вся система должна уметь быстро перестраивать свои действия с учетом нового состояния и окружающей среды.

Наша команда на выставке
Наша команда на выставке

Что меняется в современных VLA

В своей статье о конференции ICRA 2026 мой коллега рассказывал, что Physical AI — это не одна универсальная модель, а набор связанных уровней. Один модуль отвечает за восприятие, другой — за планирование, третий — за физически корректное выполнение движения, четвертый — за низкоуровневое управление приводами.

В задаче с движущимся объектом это особенно заметно: робот может правильно распознать объект, но ошибиться при прогнозировании его траектории. Или успеть построить хороший план движения, но выполнить его слишком поздно. Или, наоборот, вовремя подвести кисть к детали, но потерять устойчивость корпуса в момент захвата. 

Поэтому развитие современных VLA идет сразу по четырем направлениям:

  • Временной контекст. Модели начинают анализировать не один кадр, а их последовательность, чтобы понимать движение объекта и самого робота. Фактически модель начинает видеть не только состояние сцены, но и ее развитие во времени.

  • Более свежие действия. Управление становится ближе к замкнутому циклу: робот постоянно сравнивает ожидаемое состояние мира с тем, что действительно происходит, и при необходимости меняет свое решение.

  • Физические сигналы. Роботу нужны данные о положении суставов, движении корпуса, состоянии кисти, силе контакта и тактильные сигналы. Объединение этих источников делает управление значительно устойчивее в сложных сценариях.

  • Симуляция и перенос в реальность. На реальном гуманоиде сложно и дорого ошибаться, сталкиваться с объектами и пробовать нестандартные сценарии. Поэтому такие ситуации сначала моделируют в симуляции, а затем проверяют на роботе. Такой подход позволяет существенно сократить стоимость экспериментов и быстрее проверять новые архитектурные идеи.

Одновременное развитие этих направлений постепенно приближает роботов к успешной работе в реальной динамической среде. 

Почему нас заинтересовала RLDX-1

Упомянутые направления пока развиваются неравномерно: одни модели лучше работают с видео, другие — с тактильной обратной связью или ускоренным инференсом. Но есть и такие, которые позволяют развивать несколько слоев параллельно, — RLDX-1 как раз одна из них.

Архитектура RLDX-1 работает с несколькими типами информации одновременно. Motion Module анализирует последовательность кадров и помогает модели учитывать движение объектов, а Memory Module добавляет контекст из предыдущих наблюдений. Вместе эти признаки формируют Cognition Stream. Отдельно Physics Stream обрабатывает физические сигналы робота, например тактильные данные и моменты в суставах, а Action Stream — состояние робота и будущие действия. Затем Multi-Stream Action Transformer объединяет информацию из всех трех потоков и формирует последовательность команд для робота.

Обзор RLDX-1. На основе видеонаблюдений и языковых инструкций RLDX-1 предсказывает будущие действия с помощью трех ключевых функций: распознавания движения с помощью Motion Module, долговременной памяти через Memory Module и физического восприятия с помощью Physics Stream, который принимает крутящий момент и тактильные сигналы. Источник
Обзор RLDX-1. На основе видеонаблюдений и языковых инструкций RLDX-1 предсказывает будущие действия с помощью трех ключевых функций: распознавания движения с помощью Motion Module, долговременной памяти через Memory Module и физического восприятия с помощью Physics Stream, который принимает крутящий момент и тактильные сигналы. Источник

На первый взгляд это может показаться незначительным архитектурным изменением. На практике же разные источники информации — камеры, датчики суставов, IMU и тактильные сенсоры — работают по-разному: дают данные с разной частотой, с разными задержками и отвечают за разные части задачи. 

Авторы RLDX-1 заявляют, что их архитектура помогает учитывать движение, долгий контекст и физическую обратную связь при манипуляциях, требующих точных и согласованных движений (dexterous manipulation). Однако, это свежий технический отчет, поэтому его результаты стоит воспринимать как интересный исследовательский ориентир, а не как утвержденный стандарт. 

Что мы делаем в этом направлении в RnD MWS

Одно из ограничений модели RLDX-1 в том, что она не учитывает баланс корпуса робота и работает только с движением рук (остальная часть, условно, прикована к полу). Сейчас моя задача поменять эту архитектуру так, чтобы можно было контролировать все тело, то есть создать whole-body dynamic VLA для работы с объектами, которые движутся во время выполнения задачи.

Для экспериментов мы выбрали Unitree G1 — один из популярных китайских роботов. И у нас уже готово решение, которое позволяет передавать данные между ним и RLDX-1 в одном формате.

Unitree G1 в лаборатории перед выставкой
Unitree G1 в лаборатории перед выставкой

Первый сценарий, который мы проверяем, — деталь на конвейере. Роботу нужно увидеть объект, понять, как быстро и куда он движется, выбрать момент перехвата и успеть подвести кисть в нужную точку. При этом движение руки должно быть согласовано с корпусом, положением ног и балансом робота.

Каждый этап так или иначе зависит от предыдущего, поэтому мы рассматриваем задачу как замкнутый цикл:

  • робот наблюдает объект и свое состояние;

  • оценивает, куда объект движется;

  • выбирает момент и точку перехвата;

  • выполняет движение всем телом;

  • проверяет, произошел ли захват;

  • корректирует действие или восстанавливается после промаха, а затем все по новой.

Главная сложность в том, что ошибка робота на одном этапе влияет на все его последующие действия: если робот немного неверно оценил скорость объекта, он промахивается рукой. Из-за этого меняется поза корпуса и запас устойчивости, а объект при этом продолжает двигаться. Поэтому обучать модель нужно комплексно.

Сейчас мы решаем эту задачу в симуляции: воспроизвели сцену с движущимся конвейером и интегрировали существующую архитектуру RLDX-1 с нашей робототехнической платформой. Пробуем разные скорости конвейера, траектории, формы и веса предметов, освещение, задержки камеры и инференса, ошибки и размытые данные сенсоров. Это позволяет отдельно оценить влияние каждого фактора, не подвергая реального робота лишнему риску.

Симуляционная сцена в Isaac Sim: гуманоид взаимодействует с контейнером на движущемся конвейере.
Симуляционная сцена в Isaac Sim: гуманоид взаимодействует с контейнером на движущемся конвейере.

При этом симуляция не полностью воспроизводит поведение реальной платформы. На физическом роботе проявляются люфты механизмов, особенности приводов, задержки управления и шум сенсоров. Поэтому при переносе модели важно учитывать характеристики конкретной платформы и при необходимости адаптировать ее на реальных данных.

Отдельный блок экспериментов посвящен тому, какой объем информации нужен модели для понимания динамики сцены. Здесь важна не максимальная длина истории, а минимальный контекст, которого достаточно для надежной оценки движения. Чем больше кадров получает модель, тем выше вычислительная нагрузка и задержка, при этом качество не обязательно продолжает расти.

Этой темой занимаемся не только мы. Есть уже опубликованные исследования, например «How much context does we need». В этой работе выяснили, что для разного типа заданий нужно разное число фреймов. Для простых задач, вроде «подвинуть объект», достаточно 1 фрейма, а для задач с временной зависимостью — от 8 до 16 кадров.

Еще один важный параметр — частота обновления действий. Вместо того чтобы выполнять заранее рассчитанный action chunk до конца, система регулярно получает новые наблюдения и уточняет траекторию. Единого общепринятого решения здесь пока нет, поэтому в современных работах используются разные подходы.

Например, в статье «Towards Generalizable Robotic Manipulation in Dynamic Environments» используют несколько фреймов и карту движения пикселей для неявного определения направления и скорости движения объекта. А в DynamicVLA предлагают использовать новый инференс, который запускается параллельно с выполнением текущего action chunk. Действия, которые к моменту исполнения уже не соответствуют текущему состоянию сцены, отбрасываются или заменяются более свежими предсказаниями.

Итог

За последние несколько лет развития VLA, роботов научили связывать язык, зрение и действие. Благодаря этому машины уже умеют понимать естественные команды человека и выполнять достаточно сложные манипуляции с объектами.

Следующий этап — научить роботов действовать в динамике: учитывать движение объектов, задержки сенсоров, физический контакт и собственное тело.

Именно в этом направлении мы сейчас работаем в RnD направлении PhysicalAI MWS. Наша цель — построить систему, которая объединит восприятие, прогнозирование, управление всем телом и обратную связь в единый замкнутый цикл. Пока большая часть экспериментов проходит в симуляции, но именно такой подход, как нам кажется, способен приблизить гуманоидов к реальной работе в мире, где объекты не будут ждать, когда робот закончит думать.