AI Radar
WorldDiT в одной диффузионной модели одновременно прогнозирует действия робота и будущий вид наблюдаемой сцены. Bagel Labs опубликовала веса на Hugging Face и технический отчёт, сделав акцент на эффективности модели размером менее миллиарда параметров.
Вместо отдельной управляющей политики, которая предсказывает только следующую команду, WorldDiT учится решать две связанные задачи параллельно: выбирать действие и моделировать, как после него изменится окружающая обстановка. Для этого используется единый диффузионный бэкенд с общими параметрами. Таким образом, представление о динамике сцены не остаётся вспомогательным компонентом, а непосредственно участвует в формировании управляющего сигнала.
Такой подход находится между двумя распространёнными крайностями в робототехнике. С одной стороны, компактные политики управления могут не иметь достаточно богатой модели мира; с другой — единые системы восприятия, языка и контроля нередко строятся поверх многомиллиардных vision-language-моделей. Bagel Labs выбрала унифицированную архитектуру, но постаралась сохранить её небольшой: WorldDiT остаётся заметно меньше одного миллиарда параметров. Это особенно существенно при исполнении непосредственно на роботе, где объём памяти и задержка зависят в том числе от размера модели.
Главным подтверждением качества разработчики называют результаты на LIBERO — симуляционном бенчмарке языково обусловленных задач манипулирования. По данным Bagel Labs, WorldDiT находится на границе лучших соотношений между результатом и числом параметров. Речь при этом не заявлена как безусловное первое место в общей таблице: основной тезис состоит в том, что сильные показатели получены без перехода к многомиллиардному масштабу. Оценивать перенос этих результатов на физические платформы всё равно предстоит отдельно, поскольку опубликованное сравнение относится именно к стандартному симуляционному тесту.
Релиз продолжает линию открытых диффузионных моделей лаборатории. В октябре 2025 года Bagel Labs выпустила Paris — децентрализованную модель генерации изображений, эксперты которой обучались раздельно без обмена градиентами, параметрами и активациями, а при инференсе объединялись лёгким маршрутизатором. В мае 2026-го Paris 2.0 перенесла эту схему на видео; лаборатория сообщала о снижении Frechet Video Distance с 561,04 до 279,01 при сравнении с монолитной моделью на сопоставимых данных и вычислениях. Связанная работа о гетерогенных децентрализованных диффузионных моделях была принята на CVPR 2026.
Переход от генерации медиа к робототехнике выглядит последовательным: видео-диффузионные бэкенды всё чаще используются как основа моделей мира, способных предсказывать развитие сцены. Публикация не только отчёта, но и весов WorldDiT позволяет исследователям проверить заявленное соотношение качества и размера, адаптировать модель под другие наборы задач и выяснить, насколько совместное предсказание кадров и действий помогает уже за пределами LIBERO.
Компактная открытая модель может снизить порог для экспериментов с управлением роботами там, где многомиллиардные системы слишком дороги или медленны. Общий бэкенд для действий и динамики сцены также даёт практический способ проверить, помогает ли явное моделирование будущего повысить устойчивость политики без резкого роста числа параметров.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.