AI Radar
AgiBot представила предварительную версию WITA-Omni — мультимодальной модели, которая одновременно воспринимает аудио и видео, принимает решение об ответе и синхронно генерирует речь, жесты и мимику. Разработчики пытаются заменить ею традиционную цепочку независимых модулей единой временной моделью взаимодействия.
Обычный разговорный робот последовательно распознаёт речь, интерпретирует текст, составляет ответ, озвучивает его и только затем запускает жесты. Задержки на каждом переходе складываются, часть смысла теряется при передаче между модулями, а голос, движения и выражение лица расходятся по темпу. WITA-Omni построена вокруг другой задачи: понимать происходящее в непрерывном аудиовизуальном потоке, определять, кто обращается к роботу и когда нужно ответить, а затем говорить и двигаться без ожидания завершения всей цепочки.
Архитектура расширяет схему Thinker–Talker третьим компонентом Actor. Thinker сводит текст, изображения, звук и видео в общее пространство представлений и принимает высокоуровневые решения; Talker потоково формирует речь из его скрытого состояния; Actor управляет движениями и мимикой. При этом Actor получает не только смысловое состояние Thinker, но и аудиопредставления Talker, поэтому может учитывать скорость речи, паузы, ударения и эмоциональную окраску. Все три потока продвигаются по единой временной шкале, а не передают друг другу уже законченные результаты.
Для обучения AgiBot использовала многоуровневый набор данных. На промежуточном этапе заявлены десятки миллионов часов мультимодальных материалов: около 40% приходится на совместные аудио и видео, 30% — на аудио, 20% — на визуальные данные и 10% — на текст. Затем модель дообучали на тысячах часов более качественных записей общения людей и роботов, данных от сенсоров при телеуправлении и размеченных видео с указанием говорящего, действий, событий и временных интервалов. Такая разметка нужна не только для правильного ответа, но и для выбора адресата, момента вступления в разговор и подходящего жеста.
Постобучение состоит из трёх стадий. SFT формирует базовые способности понимания и многопоточной генерации; OPD, или on-policy distillation, позволяет версии-«учителю» пользоваться дополнительными сведениями о временных отрезках и объектах, а затем переносит решения в обычную версию модели. На стадии RL вознаграждается не только точность ответа, но и совпадение временного интервала, правильный выбор собеседника, решение подождать или ответить и уместность инициативной реакции; для оптимизации применяется GRPO.
По опубликованным результатам WITA-Omni Preview получила 85,21 балла и первое место в DailyOmni, став лучшей в шести из восьми категорий. В частности, указаны 86,13 балла за аудиовизуальное выравнивание, 84,64 за временную последовательность событий и 85,06 за совместное рассуждение. В тестах Big Bench Audio и подмножестве Full Duplex Bench, проведённых AgiBot по открытому протоколу Speech Arena, модель также заняла первые места, включая задачи на паузы, перебивания и смену реплик. Однако это пока Preview, а сведения о результатах и обучении исходят из презентации разработки; реальную задержку, устойчивость к шуму и качество движений предстоит проверять на независимых тестах и физических роботах.
Для сервисных и домашних роботов естественный выбор момента ответа и синхронность речи с жестами могут быть не менее важны, чем точность отдельных реплик. Единая модель потенциально уменьшает задержки и объём ручных правил между ASR, языковой моделью, синтезом речи и контроллером движений. Практическая ценность, однако, будет зависеть от вычислительных требований и стабильности WITA-Omni вне подготовленных демонстраций.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.