AI Radar
Daxiao Robotics и S-Lab Наньянского технологического университета открыли ACE-Data-0 — синхронизированный мультимодальный датасет для обучения роботов на человеческих действиях в реальных домашних условиях. Он включает 150 часов записей, 17 млн видеокадров и 75 тысяч эпизодов взаимодействия.
ACE-Data-0 охватывает 200 классов задач, выполненных 50 участниками в двух реальных домашних пространствах. В отличие от обычных коллекций видео, набор одновременно фиксирует изображение от первого лица и нескольких внешних камер, движения тела и рук, шестимерные траектории объектов, многоканальный звук и тактильные сигналы. Все модальности сведены к общей временной шкале и мировой системе координат, поэтому момент касания, положение предмета, позу человека и соответствующий звук можно сопоставить напрямую.
Для сбора данных использовались две конфигурации движка ACE. Настольная система предназначена для точных манипуляций — захвата, наливания, протирания, резки и складывания — и плотно окружает рабочую область камерами, оптическим захватом движения и тактильными устройствами. Комнатная конфигурация покрывает кухню, столовую, гостиную и спальню, записывая перемещения человека, переходы между зонами и длинные последовательности действий. Носимое устройство участника передаёт четыре потока с камер «рыбий глаз», IMU и собственную позу, а внешние камеры компенсируют заслонённые участки.
Ключевая инженерная часть набора — не количество сенсоров, а их калибровка. Камеры, перчатки, микрофоны и системы motion capture работают с разной частотой и независимыми часами; даже сдвиг на несколько миллисекунд способен отделить тактильный импульс от видимого контакта. ACE-Data-0 предоставляет синхронизированные временные линии, параметры камер, состояния тела и кистей, сетки и 6DoF-позы объектов, траектории, рамки, сведения о контактах и текстовые описания. Значительная часть разметки получена непосредственно из откалиброванной системы, а не восстановлена моделью после съёмки.
Задания делятся на короткие, но всё же многоминутные взаимодействия с предметами, домашние цепочки продолжительностью 20–30 минут и примерно пятиминутные взаимодействия человека со сценой. Участникам сообщали конечную цель, не навязывая пошаговый сценарий. Поэтому данные сохраняют выбор разных инструментов и маршрутов, колебания, возвраты к предыдущим шагам, перестройку плана и восстановление после ошибок — то, что обычно вычищается из постановочных демонстраций, но неизбежно встречается у домашнего робота.
Вместе с данными подготовлен трёхуровневый бенчмарк. Он последовательно проверяет вывод контакта и тактильных сигналов по видео, восстановление состояния человека и объектов при заслонениях, а затем понимание полного цикла взаимодействия руки с предметом. Испытания более чем 30 существующих методов выявили слабые места в обработке контакта, сильных перекрытий, движения камеры от первого лица, необычных ракурсов и длинных заданий. Помимо оценки моделей, набор рассчитан на имитационное обучение, VLA-системы, мировые модели, политики управления и перенос человеческих демонстраций на разные роботизированные платформы.
ACE-Data-0 позволяет учить модели не только распознавать видимое действие, но и связывать его с контактом, усилием, звуком и последующим изменением состояния объекта. Это особенно полезно для длинных домашних задач, где роботу нужно помнить предыдущие шаги и восстанавливаться после отклонения от плана. Единая калибровка также упрощает исследования переноса человеческих демонстраций на роботов, хотя реальную ценность набора ещё предстоит подтвердить независимыми экспериментами.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.