От статичного поиска к интерактивному диалогу
Традиционные системы геолокации (VPR) опираются на парадигму однократного извлечения данных: пользователь вводит запрос или загружает фото, а система выдает результат. Этот подход часто терпит неудачу из-за неоднозначности естественного языка. Авторы из DialogueVPR предлагают сменить парадигму на reasoning retrieval (поиск через рассуждение). Теперь локация определяется как интерактивный процесс, где ИИ задает уточняющие вопросы, чтобы сузить круг поиска.
Архитектура DlgPR и DQ-pilot
В основе метода лежит унифицированная рамка, объединяющая кросс-модальный многоуровневый ретривер и интеллектуального опрашивающего агента DQ-pilot. Обучение DQ-pilot проводилось в два этапа:
- Supervised Fine-Tuning (SFT): на курированном наборе данных DQ-cities-20k.
- Reinforcement Learning (RL): уточнение через GRPO на более сложном сплите DQ-cities-10k.
Для обучения применялись две специфические метрики: Discriminative Difficulty Index (DDI) для выборки примеров и Positional Retrieval Gain (PRG) — награда, измеряющая реальное улучшение позиции правильного ответа после каждого вопроса.
Новый бенчмарк DlgQuest-Cities
Для поддержки нового подхода исследователи создали DlgQuest-Cities — первый крупномасштабный диалоговый бенчмарк для распознавания мест. Это позволяет объективно оценивать способность моделей работать с неполными и размытыми описаниями локаций в реальных условиях.
Результаты и значимость
Эксперименты показывают, что подход на основе рассуждений значительно превосходит базовые методы. Принятие работы в CVPR 2026 подтверждает важность перехода от статичных запросов к контекстно-зависимым диалогам в компьютерном зрении. Код и модели доступны для воспроизведения результатов.
Источник: arXiv cs.AI ↗
