DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarJuly 29, 2026

    AI Radar

    Bagel Labs открыла веса компактной робототехнической модели WorldDiT

    WorldDiT в одной диффузионной модели одновременно прогнозирует действия робота и будущий вид наблюдаемой сцены. Bagel Labs опубликовала веса на Hugging Face и технический отчёт, сделав акцент на эффективности модели размером менее миллиарда параметров.

    July 29, 2026·3 min read·Источник: TestingCatalog
    02

    Что изменилось

    Вместо отдельной управляющей политики, которая предсказывает только следующую команду, WorldDiT учится решать две связанные задачи параллельно: выбирать действие и моделировать, как после него изменится окружающая обстановка. Для этого используется единый диффузионный бэкенд с общими параметрами. Таким образом, представление о динамике сцены не остаётся вспомогательным компонентом, а непосредственно участвует в формировании управляющего сигнала.

    Такой подход находится между двумя распространёнными крайностями в робототехнике. С одной стороны, компактные политики управления могут не иметь достаточно богатой модели мира; с другой — единые системы восприятия, языка и контроля нередко строятся поверх многомиллиардных vision-language-моделей. Bagel Labs выбрала унифицированную архитектуру, но постаралась сохранить её небольшой: WorldDiT остаётся заметно меньше одного миллиарда параметров. Это особенно существенно при исполнении непосредственно на роботе, где объём памяти и задержка зависят в том числе от размера модели.

    Главным подтверждением качества разработчики называют результаты на LIBERO — симуляционном бенчмарке языково обусловленных задач манипулирования. По данным Bagel Labs, WorldDiT находится на границе лучших соотношений между результатом и числом параметров. Речь при этом не заявлена как безусловное первое место в общей таблице: основной тезис состоит в том, что сильные показатели получены без перехода к многомиллиардному масштабу. Оценивать перенос этих результатов на физические платформы всё равно предстоит отдельно, поскольку опубликованное сравнение относится именно к стандартному симуляционному тесту.

    Релиз продолжает линию открытых диффузионных моделей лаборатории. В октябре 2025 года Bagel Labs выпустила Paris — децентрализованную модель генерации изображений, эксперты которой обучались раздельно без обмена градиентами, параметрами и активациями, а при инференсе объединялись лёгким маршрутизатором. В мае 2026-го Paris 2.0 перенесла эту схему на видео; лаборатория сообщала о снижении Frechet Video Distance с 561,04 до 279,01 при сравнении с монолитной моделью на сопоставимых данных и вычислениях. Связанная работа о гетерогенных децентрализованных диффузионных моделях была принята на CVPR 2026.

    Переход от генерации медиа к робототехнике выглядит последовательным: видео-диффузионные бэкенды всё чаще используются как основа моделей мира, способных предсказывать развитие сцены. Публикация не только отчёта, но и весов WorldDiT позволяет исследователям проверить заявленное соотношение качества и размера, адаптировать модель под другие наборы задач и выяснить, насколько совместное предсказание кадров и действий помогает уже за пределами LIBERO.

    Почему это важно

    Компактная открытая модель может снизить порог для экспериментов с управлением роботами там, где многомиллиардные системы слишком дороги или медленны. Общий бэкенд для действий и динамики сцены также даёт практический способ проверить, помогает ли явное моделирование будущего повысить устойчивость политики без резкого роста числа параметров.

    Primary and supporting sources

    • Bagel Labs launches WorldDiT world model for roboticsOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    July 29, 2026
    1. 01Mythos ускорила криптоанализ и поставила Microsoft перед очередью из сотен уязвимостей
    2. 02AgiBot объединила речь, восприятие и движения робота в WITA-Omni Preview
    3. 03Сотрудники ведущих ИИ-лабораторий предложили создать общий «тормоз» для фронтирных моделей
    4. 04Ant Group выпустила Ling 3.0 Flash — разреженную агентную модель на 124 млрд параметров
    Back to AI Radar