AI Radar
VPP2 возглавила RoboDojo: сначала прогноз видео, затем действия робота
Робототехническая модель VPP2 заняла первое место в симуляционном тесте RoboDojo по средней успешности и баллу. Её разработчики обучали прогнозу видео и действиям поэтапно, а затем проверили модель на настоящем двухруком роботе.
Что изменилось
RoboDojo проверяет не только знакомые роботу движения. В симуляции ему предлагают 42 задачи для двух манипуляторов: меняют расположение предметов и условия операции, проверяют точность, память о предыдущих шагах и понимание инструкций с новыми формулировками. Для такого теста доля полностью выполненных заданий и средний балл отвечают на разные вопросы. Первый показатель говорит, довёл ли робот работу до конца, второй учитывает продвижение по этапам, даже если завершить задачу не удалось.
По опубликованным результатам, VPP2 получила в RoboDojo 32,26% средней успешности и 39,26 балла, заняв первое место по обоим сводным показателям. В материале также указано лидерство в трёх отдельных категориях: обобщении на новые условия, точных манипуляциях и памяти. Для сравнения приведены 22,48% и 28,97 балла у GPT-6-Astra. Эти цифры относятся к конкретной симуляционной оценке: они показывают разницу на наборе заданий RoboDojo, а не вероятность успеха робота при любой работе в реальном мире.
Исследователи исходят из слабого места моделей «мир плюс действие». Если предсказанное видео выглядит правдоподобно, но показывает захват не того предмета, построенное по нему движение тоже окажется неверным. При этом совместное обучение предсказанию кадров и действиям может ухудшить способность видеомодели переносить знания на незнакомые сцены. Поэтому обучение VPP2 разделили на этапы. Сначала модель учится предсказывать целую операцию по видео и подробной инструкции, затем её ускоряют, а уже после добавляют компонент, который переводит прогноз в команды для робота.
В основе видеокомпонента лежит Wan2.1-I2V-14B. При подготовке данных операции разбивали на законченные по смыслу эпизоды и уточняли в описании, какой манипулятор работает с каким объектом. Так модель обучается не просто продолжать несколько кадров, а представлять изменение сцены от начала до конца действия. Затем команда перешла к прогнозу фиксированного восьмисекундного фрагмента и применила дистилляцию, чтобы сократить вычисления до одного шага генерации. Заявленное время такого прогноза составляет около 0,12 секунды.
За команды движения отвечает отдельный Action DiT с 0,9 млрд параметров. На раннем этапе его обучения основные параметры видеомодели замораживали, оставляя для адаптации LoRA: это способ подстроить модель через небольшие дополнительные веса, не переучивая её целиком. По приведённым данным, генерация фрагмента действий вместе с видеопрогнозом занимает около 0,22 секунды. В дополнительном тесте на настоящем двухруком роботе ALOHA VPP2, без дообучения под десять проверочных типов операций, показала среднюю успешность 58,5% против 40% у π0.5. Это полезная проверка переноса из симуляции, но охват реальных испытаний пока ограничен этими задачами.
Почему это важно
Для исследователей VPP2 даёт проверяемую схему обучения: отделить прогноз развития сцены от обучения моторике и измерить, что сохраняется при переносе на новые задачи. При сравнении моделей стоит смотреть и на симуляцию, и на испытания на роботе.
Мнение редакции
Робототехника долго опиралась либо на обучение движениям по примерам, либо на видеомодели, которые представляют будущее сцены. VPP2 от связанной с Университетом Цинхуа компании Xingdong Jiyuan соединяет эти подходы последовательно: сначала учит модель предсказывать ход операции, затем превращает прогноз в действия. Теперь эту связку предстоит проверять на других роботах и задачах.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.