Что такое Gemini Robotics ER 2
Google DeepMind анонсировала Gemini Robotics ER 2 — новую модель для робототехники, которая действует как высокоуровневый «мозг» для физических агентов. В отличие от предыдущих версий, ER 2 позволяет роботам не только выполнять команды, но и самостоятельно планировать многошаговые задачи, адаптироваться к изменениям в реальном времени и взаимодействовать с другими машинами.
Модель интегрирована в Gemini Live API с использованием двунаправленного потокового соединения, что обеспечивает низкую задержку и плавное выполнение задач без пауз «стоп-и-думай». Разработчики могут получить доступ к модели через Gemini API, Google AI Studio и Gemini Enterprise Agent Platform.
Ключевые метрики и производительность
В сравнении с предыдущей версией ER 1.6, новая модель демонстрирует значительный прогресс в понимании видео и точности действий. Ниже представлены ключевые показатели эффективности Gemini Robotics ER 2:
| Метрика | Результат ER 2 | Значение |
|---|---|---|
| Точность классификации прогресса задачи | 57.4% | Оценка способности робота отслеживать прогресс выполнения задачи по видеопотоку (5 уровней: 0-20%, 20-40% и т.д.) |
| Точность поиска момента (Moment-finding) | 91.3% | Способность точно определить кадр, когда событие завершено (например, остановка наливания кофе) |
| Среднее абсолютное отклонение по времени | 0.96s | Точность определения момента события во времени |
| Скорость выполнения | 4x быстрее | По сравнению с более крупными моделями, при этом затраты на вычисления значительно ниже |
Пространственное мышление и безопасность
Модель улучшает базовые способности к пространственному reasoning, измеряемые через три бенчмарка:
- Обнаружение успеха/неудачи: Работает с сырыми видеопотоками, а не статичными снимками, что позволяет выявлять ошибки в процессе выполнения (проливы, смещения).
- Чтение инструментов: Расширено понимание не только круглых шкал, но и цифровых дисплеев, линейных шкал, линеек и термометров. Тестирование проводилось на 10 типах инструментов.
- Улучшенный пространственный VQA: Повышена точность ответов на визуальные вопросы благодаря мультимодальному пониманию Gemini.
Также модель демонстрирует высокие результаты в безопасности, особенно в следовании инструкциям и соблюдении дистанции до человека.
Примеры использования и коллаборация
Google продемонстрировала работу ER 2 на роботе Boston Dynamics Spot, который по голосовой команде самостоятельно находит и приносит попкорн. Модель управляет API навигации и манипуляторов, обеспечивая плавное выполнение задачи.
Важным нововведением стала поддержка многопользовательской коллаборации. ER 2 позволяет разным роботам (например, колесному роверу и гуманоидному роботу Apptronik Apollo 2) взаимодействовать в общем пространстве, передавая задачи друг другу на основе семантического понимания.
Доступность
Модель Gemini Robotics ER 2 доступна разработчикам через Gemini API и Google AI Studio. В частном предварительном доступе она также представлена на Gemini Enterprise Agent Platform. Исходный код с примерами конфигурации доступен на GitHub.
Источник: Google DeepMind ↗
