AI Radar
Google DeepMind расширила Gemini Robotics от управления верхней частью тела до полноценных движений гуманоидов — от стоп до кончиков пальцев. Одновременно модель embodied reasoning ER 2 получила потоковое планирование, контроль многошаговых задач и координацию роботов разных типов.
Gemini Robotics 2 представляет собой не одну монолитную нейросеть, а связку моделей с разными уровнями ответственности. Визуально-языковая модель интерпретирует видео и команды человека, рассуждает о задаче и строит план, а две vision-language-action модели переводят его в физические действия: одна отвечает за движение всего тела, другая — за кисти, захваты или манипуляторы. Такое разделение позволяет совместить высокоуровневое понимание среды с низкоуровневым моторным управлением, для которого особенно важны частота команд и точность траектории.
Предыдущее поколение в основном управляло верхней частью гуманоидного робота, тогда как новая версия поддерживает ходьбу, приседания, наклоны, вытягивание рук и манипуляции объектами в едином движении. В демонстрациях Apollo 2 от Apptronik наклоняется за лейкой, находит нужные предметы на полке и убирает их. Улучшилось и управление пятипалыми кистями: роботы могут закрывать пакет Ziploc, завязывать мусорный пакет и выкручивать лампочку. При этом DeepMind прямо признает, что скорость движений еще предстоит повышать, а показанные навыки не означают универсальности без дополнительного обучения.
Высокоуровневым «мозгом» системы служит Gemini Robotics ER 2. Модель принимает непрерывные потоки видео, аудио и текста, следит за собственным прогрессом робота, определяет начало и окончание этапов и корректирует план, если исполнение пошло не так. Низкоуровневые VLA-модели, навигационные API и пользовательские функции объявляются для нее как инструменты; при необходимости робот может вызвать и Google Search. ER 2 способна планировать следующий шаг одновременно с выполнением текущего, а интеграция с двунаправленным Gemini Live API должна уменьшить характерные паузы «остановился — подумал — продолжил». В тестах оркестрации она превосходит ER 1.6 при работе с реальными и симуляционными VLA, а также при удаленном управлении человеком.
Еще одно нововведение — совместная работа нескольких машин в общем пространстве. В одном сценарии Apollo 2 поручает двухрукому роботу Google складывать инструменты в контейнер во время уборки гаража; в другом ER 2 управляет навигацией и манипулятором Spot от Boston Dynamics. Это не обязательно означает прямую передачу моторных навыков между несовместимыми платформами: ER 2 координирует задачи на уровне целей и инструментов, а конкретные действия исполняют интерфейсы каждой машины. Отдельно обновилась локальная On-Device-модель, способная работать без интернета и быстрее адаптироваться к корпусам с существенно иными сенсорами, формой и числом степеней свободы.
Физические агенты повышают цену любой ошибки, поэтому DeepMind добавила обнаружение находящихся рядом людей, вызовы защитных инструментов и безопасную остановку при чрезмерном сближении. Компания также применяет ограничения на нескольких модельных слоях и представила ASIMOV-Agentic — бенчмарк для оценки безопасности систем, в которых несколько AI-компонентов совместно управляют роботом. Эти меры не снимают проблему непредвиденного поведения: frontier-модели по-прежнему могут ошибаться в незнакомых обстоятельствах, а обучение Robotics 2 сочетало телеметрию операторов, видео и симуляции для конкретных классов задач.
Для разработчиков сейчас доступна именно Gemini Robotics ER 2: ее можно использовать через Gemini API и Google AI Studio, а на Gemini Enterprise Agent Platform идет закрытое предварительное тестирование. Google публикует примеры настройки физического агента и подключения управляющих интерфейсов. Это дает командам способ экспериментировать с планированием и оркестрацией, однако для переноса демонстраций в реальную среду все равно потребуются совместимый моторный слой, обучение нужным действиям и собственный контур безопасности.
Разделение рассуждения и моторного исполнения позволяет подключать один высокоуровневый агент к разным роботам, не заставляя его напрямую генерировать каждое движение. Для практических проектов особенно полезны потоковый API, самокоррекция и координация нескольких платформ, но демонстрации пока нельзя воспринимать как готовую универсальную автономность.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.