DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarJuly 30, 2026

    AI Radar

    Gemini Robotics 2 научилась управлять всем телом робота и координировать несколько машин

    Google DeepMind расширила Gemini Robotics от управления верхней частью тела до полноценных движений гуманоидов — от стоп до кончиков пальцев. Одновременно модель embodied reasoning ER 2 получила потоковое планирование, контроль многошаговых задач и координацию роботов разных типов.

    July 30, 2026·4 min read·Источник: Google Blog · The Verge +1
    04

    Что изменилось

    Gemini Robotics 2 представляет собой не одну монолитную нейросеть, а связку моделей с разными уровнями ответственности. Визуально-языковая модель интерпретирует видео и команды человека, рассуждает о задаче и строит план, а две vision-language-action модели переводят его в физические действия: одна отвечает за движение всего тела, другая — за кисти, захваты или манипуляторы. Такое разделение позволяет совместить высокоуровневое понимание среды с низкоуровневым моторным управлением, для которого особенно важны частота команд и точность траектории.

    Предыдущее поколение в основном управляло верхней частью гуманоидного робота, тогда как новая версия поддерживает ходьбу, приседания, наклоны, вытягивание рук и манипуляции объектами в едином движении. В демонстрациях Apollo 2 от Apptronik наклоняется за лейкой, находит нужные предметы на полке и убирает их. Улучшилось и управление пяти­палыми кистями: роботы могут закрывать пакет Ziploc, завязывать мусорный пакет и выкручивать лампочку. При этом DeepMind прямо признает, что скорость движений еще предстоит повышать, а показанные навыки не означают универсальности без дополнительного обучения.

    Высокоуровневым «мозгом» системы служит Gemini Robotics ER 2. Модель принимает непрерывные потоки видео, аудио и текста, следит за собственным прогрессом робота, определяет начало и окончание этапов и корректирует план, если исполнение пошло не так. Низкоуровневые VLA-модели, навигационные API и пользовательские функции объявляются для нее как инструменты; при необходимости робот может вызвать и Google Search. ER 2 способна планировать следующий шаг одновременно с выполнением текущего, а интеграция с двунаправленным Gemini Live API должна уменьшить характерные паузы «остановился — подумал — продолжил». В тестах оркестрации она превосходит ER 1.6 при работе с реальными и симуляционными VLA, а также при удаленном управлении человеком.

    Еще одно нововведение — совместная работа нескольких машин в общем пространстве. В одном сценарии Apollo 2 поручает двухрукому роботу Google складывать инструменты в контейнер во время уборки гаража; в другом ER 2 управляет навигацией и манипулятором Spot от Boston Dynamics. Это не обязательно означает прямую передачу моторных навыков между несовместимыми платформами: ER 2 координирует задачи на уровне целей и инструментов, а конкретные действия исполняют интерфейсы каждой машины. Отдельно обновилась локальная On-Device-модель, способная работать без интернета и быстрее адаптироваться к корпусам с существенно иными сенсорами, формой и числом степеней свободы.

    Физические агенты повышают цену любой ошибки, поэтому DeepMind добавила обнаружение находящихся рядом людей, вызовы защитных инструментов и безопасную остановку при чрезмерном сближении. Компания также применяет ограничения на нескольких модельных слоях и представила ASIMOV-Agentic — бенчмарк для оценки безопасности систем, в которых несколько AI-компонентов совместно управляют роботом. Эти меры не снимают проблему непредвиденного поведения: frontier-модели по-прежнему могут ошибаться в незнакомых обстоятельствах, а обучение Robotics 2 сочетало телеметрию операторов, видео и симуляции для конкретных классов задач.

    Для разработчиков сейчас доступна именно Gemini Robotics ER 2: ее можно использовать через Gemini API и Google AI Studio, а на Gemini Enterprise Agent Platform идет закрытое предварительное тестирование. Google публикует примеры настройки физического агента и подключения управляющих интерфейсов. Это дает командам способ экспериментировать с планированием и оркестрацией, однако для переноса демонстраций в реальную среду все равно потребуются совместимый моторный слой, обучение нужным действиям и собственный контур безопасности.

    Почему это важно

    Разделение рассуждения и моторного исполнения позволяет подключать один высокоуровневый агент к разным роботам, не заставляя его напрямую генерировать каждое движение. Для практических проектов особенно полезны потоковый API, самокоррекция и координация нескольких платформ, но демонстрации пока нельзя воспринимать как готовую универсальную автономность.

    Primary and supporting sources

    • Introducing Gemini Robotics ER 2Opens in a new tab
    • Google DeepMind's new AI model can control a robot's entire bodyOpens in a new tab
    • Gemini Robotics 2 Brings Google's AI Into the Physical WorldOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    July 30, 2026
    1. 01GPT‑5.6 Sol сократила стоимость инференса на 20%, а новый harness утроил результат на ARC‑AGI‑3
    2. 02Dream‑Cubed генерирует редактируемые Minecraft-миры с точностью до отдельного блока
    3. 03Grok Voice Think Fast 2.0 отвечает голосом за 0,7 секунды и запускает инструменты во время речи
    4. 04iFlytek перевела цифровых людей на генерацию мимики и движений в реальном времени
    Back to AI Radar