Главная/Блог/Гайд/Google DeepMind Gemini Robotics 2:…
Гайд9 мин чтения · 30 июля 2026 г.

Google DeepMind Gemini Robotics 2: Новый уровень контроля роботов

DeepMind представила Gemini Robotics 2 — систему с тремя моделями для управления роботами, включающую целенаправленный контроль тела, ловкость пятипалых рук и межроботное взаимодействие.

Google DeepMind Gemini Robotics 2: Новый уровень контроля роботов

Робототехника долгое время находилась в плену узкой специализации. Большинство современных роботов либо запрограммированы на выполнение строго фиксированных, повторяющихся задач, либо управляются дистанционно операторами в режиме реального времени. Они не способны адаптироваться к непредсказуемым изменениям окружающей среды, а навыки, отработанные на одной платформе, практически невозможно перенести на другую. Этот разрыв между «умным» программным обеспечением и «глупым» аппаратным обеспечением тормозил развитие автономных систем. Однако Google DeepMind делает шаг, который может изменить правила игры, выпустив Gemini Robotics 2. Это не просто обновление алгоритма, а новый интеллектуальный слой для роботов следующего поколения, который переносит фокус с манипуляций на столе на полный контроль всего тела, ловкость пятипалых кистей и командную работу нескольких роботов.

Важно понимать масштаб этого события. Ранние версии систем управления роботами от DeepMind ограничивались верхней частью тела гуманоидов, что позволяло им работать за столом, но делало их беспомощными в более сложной среде. Gemini Robotics 2 стирает эти границы. Система представлена в виде трех отдельных моделей с разными уровнями доступа, каждая из которых решает свою часть общей задачи: от высокоуровневого планирования до низкоуровневого управления моторикой прямо на устройстве. Это позволяет разработчикам создавать по-настоящему адаптивные системы, способные действовать в реальном мире, а не только в симуляции.

01Три модели — одна экосистема: Архитектура Gemini Robotics 2

Ключевая особенность Gemini Robotics 2 заключается в разделении труда между различными нейросетевыми моделями. Вместо одной монолитной «черной коробки», которая пытается делать всё сразу, система использует три специализированных компонента. Такой подход позволяет оптимизировать вычислительные ресурсы и повысить надежность работы. Давайте разберем каждую из них подробнее.

1. Gemini Robotics 2 (VLA): Моторная кора

Первая модель — это Vision-Language-Action (VLA) модель. Её задача — преобразовывать визуальные и языковые входные данные в конкретные моторные команды. Именно эта модель управляет физическими действиями робота. Она способна управлять полноразмерными гуманоидами, контролируя движение от стоп до кончиков пальцев, а также двуручными роботами. Особое внимание уделено дexterous manipulation (ловкому манипулированию) как с помощью пятипалых кистей, так и с помощью стандартных параллельных захватов. VLA модель работает как «моторная кора» робота, переводя абстрактные намерения в физические движения.

2. Gemini Robotics ER 2: Высокоуровневый разум

3>

Вторая модель — Gemini Robotics ER 2 (Embodied Reasoning) — действует как высокоуровневый мозг системы. Это модель визуального языка (VLM), основанная на архитектуре Gemini 3.5 Flash. Её роль — коммуникация с человеком, понимание физического мира и планирование многошаговых задач, которые могут длиться несколько минут. Модель принимает на вход чередующиеся текстовые, изображенные, видео и аудиоданные, имея контекстное окно до 128k токенов, и генерирует текстовые ответы до 64K токенов. ER 2 не управляет каждым мотором напрямую; вместо этого она планирует задачу и передает исполнение VLA модели, которая регистрируется как вызываемый инструмент (tool). Разработчики могут напрямую транслировать мультимодальные видео, аудио или текст в эту модель, создавая гибкие сценарии взаимодействия.

3. Gemini Robotics On-Device 2: Автономность на краю сети

Третья модель — Gemini Robotics On-Device 2 — оптимизирована для запуска локально на самом роботе. Это критически важно для приложений, где задержка сети (latency) недопустима или где отсутствует стабильное подключение к интернету. Построенная на базе технологий Gemini Robotics 1.5 и локальных моделей Google Gemma, она принимает на вход текст, изображения и проприоцептивные данные робота (числовые значения положения суставов, скорости и т.д.), а на выходе выдает числовые значения действий. Эта модель обеспечивает быструю реакцию и работу в автономном режиме, что делает её идеальной для мобильных платформ и роботов, работающих в полевых условиях.

💡
Разделение труда. Важно понимать архитектуру: ER 2 планирует и отслеживает прогресс задачи, а затем делегирует выполнение моторики VLA. Это позволяет системе «думать» о стратегии, пока «руки» выполняют тактику. Разработчики регистрируют низкоуровневые интерфейсы управления (например, API навигации или модели VLA) как вызываемые инструменты, что открывает путь для создания сложных агентов.

02Полный контроль тела: От стола к пространству

Одним из самых значимых прорывов Gemini Robotics 2 является переход от управления только верхней частью тела к полному контролю всего тела (whole body control). В предыдущих версиях роботы могли эффективно работать за столом, но их способность перемещаться в пространстве была ограничена. Новая система демонстрирует способность управлять гуманоидом Apptronik Apollo 2 так, что он может ходить, наклоняться и манипулировать объектами в трехмерном пространстве.

Google DeepMind Gemini Robotics 2: Новый уровень контроля роботов

Наглядный пример работы системы выглядит следующим образом: робота просят выполнить инструкцию «положите лейку в зеленую корзину на нижней полке». Apollo 2 самостоятельно подходит к столу, поднимает лейку, делает несколько шагов к стеллажу и аккуратно размещает объект в указанном месте. Это требует сложной координации баланса, движения ног и точности рук одновременно. Однако DeepMind честно указывает на существующие ограничения: скорость движения роботов все еще требует улучшения. Система функциональна, но пока не достигает скорости, необходимой для массового промышленного применения в реальном времени.

03Ловкость пальцев: Вызов многопалого манипулирования

Самым сложным аспектом робототехники остается манипуляция с использованием пятипалых кистей. Gemini Robotics 2 управляет кистью SharpaWave с 22 степенями свободы на Apollo 2, выполняя такие задачи, как завязывание узлов и запечатывание пакетов ziplock. Однако результаты показывают, что это остается «слабой осью» системы. Успешность выполнения задач варьируется от 32% до 92% в зависимости от сложности.

Интересно, что один и тот же чекпоинт модели используется для управления тремя разными воплощениями роботов: Apollo 2 с кистями SharpaWave, Apollo 2 с кистями Inspire и платформой Franka Duo с захватом Robotiq. Это демонстрирует способность модели к обобщению. Ниже приведены данные об успешности выполнения задач:

  • Общее манипулирование телом (Apollo 2 + Inspire): Подъем с полки — 76.3%, со стола — 68.4%, с пола — 45.7%.
  • Многопалая ловкость (Apollo 2 + Sharpa): Откручивание лампочки — 92%, завязывание мусорного пакета — 44%, ziplock — 40%, закручивание лампочки — 36%, использование совок — 32%.
  • Ловкость захвата (Franka Duo): Точные задачи вставки — 89.6%, комплектование инструментов — 78.9%, общий pick-and-place — 74.2%.

Как видно из данных, задачи с высокой степенью свободы и сложной физикой (например, завязывание узлов или работа с мягкими материалами, как пакеты) остаются крайне сложными для модели. Тем не менее, результаты с параллельными захватами (Franka Duo) значительно выше, что указывает на то, что проблема часто кроется не в «мозге», а в сложности физического взаимодействия с объектами.

04Временной интеллект и оркестрация инструментов

Модель ER 2 решает проблему, которую редко тестируют в бенчмарках: понимание того, когда задача фактически выполнена. Это называется «классификацией прогресса». Каждому кадру видеопотока присваивается один из пяти уровней прогресса (от 0-20% до 80-100%). Gemini Robotics ER 2 достигает точности 57.4% в этой задаче, что, по заявлению DeepMind, превосходит модели предыдущего поколения и конкурирующие передовые модели.

Google DeepMind Gemini Robotics 2: Новый уровень контроля роботов

Еще одна важная функция — «поиск момента» (moment finding). Модель должна определить точный кадр, в котором происходит критическое событие. Например, момент, когда нужно прекратить наливать кофе в чашку, чтобы не перелить. ER 2 достигает точности 91.3% со средней абсолютной ошибкой в 0.96 секунды. Это позволяет системе действовать в реальном времени с высокой точностью, конкурируя с гораздо более крупными моделями, но работая в 4 раза быстрее.

⚠️
Интеграция с Gemini Live API. ER 2 интегрируется через двунаправленный потоковый интерфейс. Это устраняет паузы «стоп-и-думай», которые часто прерывают выполнение многошаговых задач. Модель также может нативно вызывать инструменты, такие как Google Search или любые пользовательские функции, что делает её мощным ядром для агентов.

Также были улучшены три пространственные способности: обнаружение успеха и неудачи теперь работает на основе сырых видеопотоков, а не статичных снимков, что позволяет улавливать пролитые жидкости или скольжение объектов в процессе выполнения. Чтение инструментов расширено с круглых шкал до цифровых дисплеев, линейных линеек и жидкостных термометров. Кроме того, DeepMind создала демо с роботом Spot от Boston Dynamics, используя ER 2 для оркестровки навигации и манипуляторов Spot.

05Межроботное сотрудничество: Командная работа

Gemini Robotics 2 вводит концепцию сотрудничества между различными типами роботов. Логика проста: ни один робот не подходит для всех задач. Колесный ровер лучше справляется с перемещением по ровному полу, в то время как гуманоид эффективнее на пересеченной местности. Роботы общаются через общее семантическое понимание, передавая подзадачи друг другу.

Демонстрационное взаимодействие показало связку Apptronik Apollo 2 и Franka F3 Duo. ER 2 координирует действия, решая, когда ровер должен доставить объект, а когда гуманоид должен его взять и установить. Это открывает путь к созданию гибких производственных линий и логистических систем, где разные роботы дополняют сильные стороны друг друга.

06On-Device 2: Адаптация к новым телам

Модель On-Device 2 нацелена на приложения, которые не могут полагаться на задержку сети. Она изначально поддерживает несколько воплощений (multi-embodiment) и наследует техники переноса движения от Gemini Robotics 1.5. DeepMind сообщает, что адаптация к новым двуручным воплощениям занимает всего несколько часов, обычно с использованием менее 200 примеров. Это работает для платформ с радикально разной формой, датчиками и степенями свободы, таких как Dexmate, SO101 и Trossen.

Результаты масштабирования данных на платформах, которых не было в процессе обучения (post-training), впечатляют:

Google DeepMind Gemini Robotics 2: Новый уровень контроля роботов
  • SO101: On-Device 2 улучшила результат с 6.7% до 53.3%, в то время как On-Device 1 осталась на уровне 6.7%.
  • Dexmate: On-Device 2 улучшила результат с 24.4% до 75.6%, в то время как On-Device 1 выросла с 13.3% до 33.3%.

Результат на SO101 особенно показателен: первая версия модели практически не могла работать на этой платформе, тогда как вторая преодолела порог в 50%. Однако модель также честно указывает на свои ограничения: она ограничена в обобщении на задачи вне распределения (out-of-distribution) и в управлении роботами с высокой степенью свободы.

07Доступность и безопасность

Доступ к моделям распределен по разным уровням. Gemini Robotics ER 2 доступна в публичном предварительном просмотре через Gemini API и Google AI Studio (используя строку модели gemini-robotics-er-2-preview), а также в частном предварительном просмотре на Gemini Enterprise Agent Platform. VLA модель и On-Device модель доступны только для партнеров с ранним доступом и доверенных тестировщиков. Начальные ноутбуки для разработчиков доступны в репозитории robotics-samples.

Кроме того, DeepMind выпустила новый бенчмарс безопасности ASIMOV-Agentic на Hugging Face под лицензией CC-BY-4.0, что позволяет сообществу оценивать надежность и безопасность агентов на базе этих моделей.

08Что это значит на практике

Для разработчиков и исследователей в России и других странах, где доступ к облачным сервисам Google может быть ограничен, важно понимать, что Gemini Robotics 2 предлагает гибридный подход. Модель ER 2, доступная через API, требует подключения к интернету, что может быть проблемой для локальных проектов. Однако On-Device 2, предназначенная для локального запуска, открывает возможности для создания автономных систем. Хотя прямая загрузка весов моделей может быть затруднена из-за ограничений доступа, наличие открытых бенчмарков (ASIMOV-Agentic) и примеров кода в репозиториях позволяет исследователям тестировать свои решения на совместимость с архитектурой DeepMind. Это шаг к стандартизации интерфейсов между «мозгом» и «телом» робота, что в будущем упростит интеграцию различных компонентов в единые робототехнические платформы.

Источник: MarkTechPost ↗