Релиз модели30 июля 2026 г., 18:17 МСК🤖 Auto

Google DeepMind представил Gemini Robotics ER 2: новый мозг для роботов

Google DeepMind выпустила модель Gemini Robotics ER 2, способную к пространственному мышлению в реальном времени, планированию многошаговых задач и коллаборации между разными роботами.

Баннер новости 4732

Что такое Gemini Robotics ER 2

Google DeepMind анонсировала Gemini Robotics ER 2 — новую модель для робототехники, которая действует как высокоуровневый «мозг» для физических агентов. В отличие от предыдущих версий, ER 2 позволяет роботам не только выполнять команды, но и самостоятельно планировать многошаговые задачи, адаптироваться к изменениям в реальном времени и взаимодействовать с другими машинами.

Модель интегрирована в Gemini Live API с использованием двунаправленного потокового соединения, что обеспечивает низкую задержку и плавное выполнение задач без пауз «стоп-и-думай». Разработчики могут получить доступ к модели через Gemini API, Google AI Studio и Gemini Enterprise Agent Platform.

Ключевые метрики и производительность

В сравнении с предыдущей версией ER 1.6, новая модель демонстрирует значительный прогресс в понимании видео и точности действий. Ниже представлены ключевые показатели эффективности Gemini Robotics ER 2:

Метрика Результат ER 2 Значение
Точность классификации прогресса задачи 57.4% Оценка способности робота отслеживать прогресс выполнения задачи по видеопотоку (5 уровней: 0-20%, 20-40% и т.д.)
Точность поиска момента (Moment-finding) 91.3% Способность точно определить кадр, когда событие завершено (например, остановка наливания кофе)
Среднее абсолютное отклонение по времени 0.96s Точность определения момента события во времени
Скорость выполнения 4x быстрее По сравнению с более крупными моделями, при этом затраты на вычисления значительно ниже

Пространственное мышление и безопасность

Модель улучшает базовые способности к пространственному reasoning, измеряемые через три бенчмарка:

  • Обнаружение успеха/неудачи: Работает с сырыми видеопотоками, а не статичными снимками, что позволяет выявлять ошибки в процессе выполнения (проливы, смещения).
  • Чтение инструментов: Расширено понимание не только круглых шкал, но и цифровых дисплеев, линейных шкал, линеек и термометров. Тестирование проводилось на 10 типах инструментов.
  • Улучшенный пространственный VQA: Повышена точность ответов на визуальные вопросы благодаря мультимодальному пониманию Gemini.

Также модель демонстрирует высокие результаты в безопасности, особенно в следовании инструкциям и соблюдении дистанции до человека.

Примеры использования и коллаборация

Google продемонстрировала работу ER 2 на роботе Boston Dynamics Spot, который по голосовой команде самостоятельно находит и приносит попкорн. Модель управляет API навигации и манипуляторов, обеспечивая плавное выполнение задачи.

Важным нововведением стала поддержка многопользовательской коллаборации. ER 2 позволяет разным роботам (например, колесному роверу и гуманоидному роботу Apptronik Apollo 2) взаимодействовать в общем пространстве, передавая задачи друг другу на основе семантического понимания.

Доступность

Модель Gemini Robotics ER 2 доступна разработчикам через Gemini API и Google AI Studio. В частном предварительном доступе она также представлена на Gemini Enterprise Agent Platform. Исходный код с примерами конфигурации доступен на GitHub.

Источник: Google DeepMind ↗