Исследования8 июля 2026 г., 15:17 МСК🤖 Auto

SearchEyes: Имитация мира для мультимодального поиска с точностью +6.2%

Исследователи представили SearchEyes — архитектуру, объединяющую визуальные данные и графы знаний через симуляцию поискового мира, что позволило обойти проблему разреженных наград в RL.

Баннер новости 3112

Проблема разрозненных данных в мультимодальном поиске

Обучение мультимодальных агентов для многошагового рассуждения (multi-hop reasoning) упирается в фундаментальную структурную проблему: существующие конвейеры формируют обучающие данные, среду поиска и сигналы вознаграждения (reward signals) независимо друг от друга. Это приводит к тому, что синтезированные структурные метаданные отбрасываются, среды зависят от непрозрачных внешних поисковых движков, а награды в обучении с подкреплением (RL) остаются слишком разреженными, так как оцениваются только на уровне всей траектории, а не отдельных шагов.

Решение: SearchEyes и «Поисковый мир»

Команда авторов во главе с Чжэнбо Цзяо (Zhengbo Jiao) предлагает архитектуру SearchEyes, которая использует типизированный граф знаний как основу для симулированного поискового мира. Этот подход унифицирует три ключевых компонента: данные, среду и награды. Ключевым нововведением является метод Perception-Knowledge Chains (PKC), который выбирает ограниченные многошаговые пути на пересечении визуальных данных и знаний из базы Wikidata5M. PKC сохраняет метаданные сущностей на каждом шаге, создавая самодостаточный мир поиска и якоря для вознаграждения на уровне каждого шага.

Техническое ядро: HaPO

Для эффективного обучения предложена методика Hop-Anchored Policy Optimization (HaPO). Она переиспользует якоря из PKC для распределения кредита (credit assignment) на уровне каждого шага, что позволяет избежать необходимости обучения отдельной модели процессуальной награды (process reward model). Это значительно упрощает архитектуру и повышает стабильность обучения.

Результаты и бенчмарки

Эксперименты проводились на шести мультимодальных бенчмарках, требующих глубоких знаний. Модель SearchEyes-27B показала состояние искусства (SOTA) среди открытых мультимодальных поисковых агентов, улучшив результат сильнейшей открытой базовой модели в среднем на 6.2 балла.

Метрика / Компонент Значение / Описание
Модель SearchEyes-27B
Улучшение над SOTA (open-source) +6.2 points (average)
База знаний Wikidata5M (визуально-знаковое пересечение)
Метод обучения Hop-Anchored Policy Optimization (HaPO)
Ключевая инновация Симулированный поисковый мир на графе знаний

Значение для индустрии

Работа SearchEyes демонстрирует переход от хаотичного сбора данных к структурированной симуляции. Сохранение метаданных на каждом шаге рассуждения позволяет агентам лучше понимать контекст и принимать более точные решения в сложных сценариях, где требуется связать визуальную информацию с фактологическими знаниями.

Источник: arXiv cs.AI ↗