Исследования17 июля 2026 г., 05:16 МСК🤖 Auto

UESF-Bench: Новый стандарт для роботов, ищущих людей

Исследователи представили UESF-Bench — первый крупный бенчмарк для оценки способности роботов не просто следовать за человеком, а сначала находить его по текстовому описанию в динамичной среде.

Баннер новости 3778

Проблема видимости: от слежения к поиску

Большинство существующих систем навигации для embodied-агентов (роботов с сенсорами) предполагают, что цель (человек) видна с самого начала эпизода. Это упрощает задачу, но не отражает реальности. В реальных сценариях робот часто должен сначала найти человека, описанного текстовой командой (например, «человек в красной футболке»), а затем персистентно следовать за ним, даже если тот скрывается или окружен другими людьми.

Существующие подходы обычно рассматривают поиск и слежение как раздельные задачи, что приводит к неэффективному переключению между режимами и потере цели. Авторы работы из arXiv (2026) предлагают объединить эти этапы в единую парадигму.

UESF-Bench: Масштаб и сложность

Для решения этой проблемы команда разработала UESF-Bench (Unified Embodied Seeking and Following Benchmark). Этот бенчмарк требует от агентов выполнения трех ключевых навыков:

  • Семантическая навигация: Поиск объекта по текстовому описанию в сложной среде.
  • Переключение и восстановление: Надежный переход от фазы поиска к фазе слежения и способность вернуть цель, если она была потеряна.
  • Отложенная идентификация: Корректное связывание текстового описания с конкретным человеком в потоке данных (delayed identity grounding).

Решение: SeekFollow-VLA

В качестве базовой модели (baseline) исследователи предложили архитектуру SeekFollow-VLA. Это vision-language-action (VLA) фреймворк, который использует механизм маршрутизации, управляемый задачей. Он позволяет модели инферировать текущую фазу (поиск или слежение) и плавно переходить между ними, избегая конфликтов в управлении.

Результаты и сравнение

Эксперименты показали, что SeekFollow-VLA превосходит как однозаголовочные (single-head), так и двухзаголовочные (dual-head) базовые модели. Особенно заметен прирост в сценариях с несколькими людьми, где важно не перепутать цели. Ниже приведена сравнительная оценка эффективности подходов в сложных условиях:

Метрика / Сценарий Single-Head Baseline Dual-Head Baseline SeekFollow-VLA (Proposed)
Успешность поиска (Single-person) Базовый уровень Умеренный рост Значительное улучшение
Стабильность слежения (Multi-person) Частые потери цели Лучше, но есть ошибки Наиболее надежное удержание
Качество переключения фаз Резкое/Неэффективное Раздельное управление Плавное, через routing mechanism

Работа устанавливает новый стандарт для оценки embodied-агентов, смещая фокус с простого слежения на комплексное взаимодействие с окружающей средой и людьми.

Источник: arXiv cs.AI ↗