Релиз модели30 июля 2026 г., 21:18 МСК🤖 Auto

Google DeepMind представил Gemini Robotics 2: полный контроль тела и кистевая ловкость

Google DeepMind выпустила три модели для физического ИИ, позволяющие роботам управлять всем телом, демонстрировать кистевую ловкость и работать в команде. Ключевое нововведение — переход от манипуляций на столе к сложным сценариям с участием человека

Баннер новости 4747

Три модели для разных задач

Вместо одной универсальной системы Google DeepMind выпустила стек из трех специализированных моделей, образующих архитектуру Gemini Robotics 2. Это позволяет разделить вычислительную нагрузку и оптимизировать работу как в облаке, так и на борту робота:

  • Gemini Robotics VLA (Vision-Language-Action): Модель, преобразующая визуальные и языковые данные в моторные команды. Она управляет движением всего тела (от ног до пальцев) и обеспечивает кистевую ловкость.
  • Gemini Robotics ER 2 (Embodied Reasoning): Высокоуровневый «мозг» на базе Gemini 3.5 Flash. Работает с контекстом до 128k токенов, планирует многоступенчатые задачи (длительностью в минуты) и координирует работу других моделей как инструментов.
  • Gemini Robotics On-Device 2: Оптимизированная версия VLA для локального запуска. Построена на базе технологий Gemini Robotics 1.5 и моделей Gemma. Позволяет роботам адаптироваться к новым телам за несколько часов (менее 200 примеров) без зависимости от сети.

Прорыв в кистевой ловкости и контроле тела

Главное отличие Gemini Robotics 2 от предыдущих версий — переход от манипуляций на столе к управлению всем телом. В демонстрациях использовался гуманоид Apptronik Apollo 2, который самостоятельно ходит, наклоняется и выполняет сложные задачи, такие как «положи лейку в зеленый ящик на нижней полке».

Особое внимание уделено кистевой ловкости (dexterity). Модель управляет 22-степенной рукой SharpaWave и стандартными параллельными захватами. Однако, как признают разработчики, это пока слабое место: успешность выполнения задач варьируется от 32% до 92% в зависимости от сложности.

Категория Платформа Задача Успешность
Кистевая ловкость Apollo 2 + Sharpa Открутить лампочку 92%
Кистевая ловкость Apollo 2 + Sharpa Завязать мусорный пакет 44%
Кистевая ловкость Apollo 2 + Sharpa Закрыть zip-lock пакет 40%
Кистевая ловкость Apollo 2 + Sharpa Открутить лампочку (другая) 36%
Кистевая ловкость Apollo 2 + Sharpa Использовать совок 32%
Общий захват Franka Duo Точная вставка 89.6%
Общий захват Franka Duo Комплектация инструментов 78.9%
Общий захват Franka Duo Общий pick-and-place 74.2%
Всё тело Apollo 2 + Inspire Взять с полки 76.3%
Всё тело Apollo 2 + Inspire Взять со стола 68.4%
Всё тело Apollo 2 + Inspire Взять с пола 45.7%

Темпоральный интеллект и мульти-роботное взаимодействие

Модель ER 2 решает проблему понимания прогресса задачи. Она классифицирует этапы выполнения (от 0% до 100%) с точностью 57.4% и определяет критические моменты (например, момент остановки наливания кофе) с точностью 91.3% и средней ошибкой 0.96 секунды. Это позволяет избежать пауз «думания» за счет интеграции с Gemini Live API.

Также представлен новый сценарий: совместная работа разных роботов. В демо-режиме гуманоид Apollo 2 взаимодействует с мобильным манипулятором Franka F3 Duo и роботом-собакой Boston Dynamics Spot. Роботы обмениваются семантическим контекстом для передачи подзадач, что особенно важно для задач, где ни один тип робота не справится в одиночку.

Локальное обучение и доступность

Модель On-Device 2 демонстрирует способность к быстрой адаптации (few-shot learning). На платформе SO101 она увеличила успешность с 6.7% до 53.3% за несколько часов, в то время как предыдущая версия (On-Device 1) застряла на отметке 6.7%. На платформе Dexmate рост составил с 24.4% до 75.6%.

На данный момент Gemini Robotics ER 2 доступна в публичном предварительном просмотре. Модели VLA и On-Device остаются закрытыми (gated) и требуют специального доступа. Для оценки безопасности новых моделей выпущен бенчмарк ASIMOV-Agentic на Hugging Face под лицензией CC-BY-4.0.

Источник: MarkTechPost ↗