AI Radar
Создатели RoboArena удалили из официальной таблицы Spirit v1.6 и несколько других моделей, а затем ужесточили правила тестирования. Поводом стали признаки того, что открытая методика позволяла разработчикам влиять на результаты.
Spirit v1.6 вышла в начале июня и ненадолго обошла Nvidia DreamZero, заняв первое место в RoboArena. Этот бенчмарк, созданный при участии Nvidia, Стэнфордского университета и Калифорнийского университета в Беркли, сравнивает универсальные робототехнические политики — программные модели, которые переводят цифровые команды в физические действия. Для молодой Spirit AI из Ханчжоу победа выглядела особенно заметно: основанная в 2024 году компания публично назвала площадку североамериканской «олимпиадой» воплощённого интеллекта.
Однако исходная схема RoboArena оставляла возможность воздействовать на рейтинг. Зарегистрироваться в качестве оценщика мог практически любой пользователь, после чего ему предлагали попарно сравнивать две случайно выбранные модели. Сами модели при этом работали не в единой контролируемой инфраструктуре, а на серверах разработчиков. Теоретически команда могла включать свой сервер преимущественно в те моменты, когда тесты проводили связанные с ней аккаунты, повышая вероятность удобных сравнений и собственных оценок.
Анализ более 4600 записей, собранных к 3 июня, показал сильную концентрацию голосов. На аккаунт ECUST Robot Lab пришлось 58% всех оценок Spirit v1.6; у него модель выигрывала 99% сравнений, тогда как среди независимых оценщиков её доля побед составляла 66%. При этом проблема не ограничивалась одним участником: у каждой модели из первой пятёрки, включая Nvidia DreamZero, не менее половины оценок обеспечивал один конкретный аккаунт. Связь ECUST Robot Lab со Spirit AI не установлена, поэтому эти данные указывают на уязвимость процедуры, но сами по себе не доказывают участие компании в манипуляции.
Команда RoboArena сообщила, что задним числом исключила результаты организаций, у которых обнаружила манипуляции с бенчмарком, не называя конкретные компании. Записи прежних оценок впоследствии исчезли с сайта, а Spirit v1.6, модель X Square Robot и несколько других участников убрали из официальной таблицы. По состоянию на 4 августа первое место занимала Nvidia DreamZero, а остальные позиции в первой девятке также принадлежали американским разработчикам, включая Google DeepMind и Physical Intelligence.
Теперь проводить тесты могут только проверенные независимые добровольцы, а для попадания в официальный рейтинг требуется не менее 100 подтверждённых оценок. Spirit v1.6 остаётся лидером отдельной неофициальной таблицы, но помечена как модель с малой выборкой: у неё записано лишь 25 оценок. По той же формальной причине в основной список не попала MolmoAct2-droid от Allen Institute for AI, поэтому исключение из официального рейтинга не во всех случаях означает установленную манипуляцию — оно также может отражать недостаток данных.
Рейтинг робототехнических моделей зависит не только от качества заданий, но и от контроля над исполнением тестов, идентичностью оценщиков и размером выборки. Командам, выбирающим модели по лидербордам, стоит проверять происхождение оценок и условия запуска, а не ориентироваться на одно место в таблице. Новая методика RoboArena делает официальный результат труднее получить, зато повышает его практическую ценность.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.