Новый уровень автономии и понимания среды
Компания Google DeepMind анонсировала выход модели Gemini Robotics ER-1.6. Это обновление фокусируется на улучшении пространственной логики и многовидового понимания (multi-view understanding). Цель — дать роботам возможность воспринимать физический мир с точностью, сопоставимой с человеческой, что критически важно для перехода от лабораторных экспериментов к реальным задачам.
Ключевые технические улучшения
Модель специализируется на трех основных направлениях, необходимых для автономных агентов:
- Визуальное и пространственное понимание: более точная интерпретация окружения.
- Планирование задач: способность выстраивать последовательность действий.
- Обнаружение успеха: умение определять, когда задача выполнена.
Совместная работа с Boston Dynamics
Особое внимание уделено новой функции — чтению приборов (instrument reading). В сотрудничестве с Boston Dynamics модель научилась считывать сложные манометры и смотровые стекла. Это позволяет роботам взаимодействовать с промышленным оборудованием, требующим точных показаний, а не просто визуального распознавания объектов.
Безопасность и доступность
Google DeepMind заявляет, что ER-1.6 является самой безопасной моделью для робототехники на данный момент. Она демонстрирует превосходное соблюдение политик безопасности в задачах на противоречивое пространственное рассуждение (adversarial spatial reasoning). Модель уже доступна разработчикам через Gemini API и Google AI Studio.
Источник: Google DeepMind ↗
