Исследования17 августа 2026 г., 11:18 МСК🤖 Auto

Активное восприятие: как роботы учатся «осматриваться» для точного выполнения задач

Исследователи представили фреймворк Active Perception, позволяющий роботам самостоятельно менять ракурс обзора для устранения неоднозначности задач, а не полагаться только на вопросы к пользователю.

Баннер новости 5903

Проблема пассивного восприятия

При взаимодействии роботов с естественным языком возникает серьезная проблема: неоднозначность целей (target ambiguity). Традиционные методы решения этой проблемы предполагают, что робот должен задать уточняющий вопрос пользователю, если не понимает задачу. Однако этот подход игнорирует физический контекст. Неясность часто возникает не из-за намерений человека, а из-за отсутствия визуальных доказательств в текущем поле зрения: объекты могут быть закрыты, текст на этикетках нечитаем, а целевой объект просто не виден.

Решение: Активное наблюдение

Авторы работы Yiwei Liu и Luwei Yang предлагают фреймворк Active Perception for Embodied Disambiguation. Его ядро — активное изменение позиции робота для сбора дополнительной визуальной информации. Система использует Vision-Language Model (VLM) для анализа накопленных визуальных данных и решений о дальнейших действиях. Алгоритм выбирает одну из трех стратегий:

  • Продолжить наблюдение: если текущих данных недостаточно, робот перемещается, чтобы увидеть скрытые детали.
  • Запросить уточнение: если даже после осмотра контекст остается неясным, робот обращается к пользователю.
  • Завершить выбор цели: если собрано достаточно дискриминативных признаков.

Ключевые преимущества

Активное наблюдение позволяет роботу не только напрямую восстанавливать недостающие доказательства, но и считывать названия объектов, метки и семантические атрибуты. Это существенно снижает когнитивную нагрузку на пользователя: уточняющие вопросы задаются только тогда, когда физический осмотр не дал результата.

Результаты экспериментов

Эксперименты на реальных роботах (real-robot experiments) показали, что предложенный метод успешно объединяет физический сбор информации и уточнение намерений пользователя в единый процесс. Это делает взаимодействие более естественным и эффективным, так как робот сначала пытается решить проблему своими « senses », и только потом просит помощи.

Аспект Традиционные методы Active Perception (предлагаемый)
Источник информации Только пользователь (вопросы) Визуальный осмотр + пользователь
Реакция на окклюзию Невозможно решить без вопроса Робот меняет ракурс для обзора
Роль VLM Интерпретация текста/образа Принятие решений о стратегии наблюдения
Эффективность Высокая нагрузка на пользователя Минимизация лишних вопросов

Источник: arXiv cs.AI ↗