Исследования7 августа 2026 г., 09:17 МСК🤖 Auto

SearchAuditor: Как AI-аудиторы спасают поисковых агентов от ошибок

Исследователи представили SearchAuditor — систему для автоматического поиска и исправления ошибок в длинных сессиях веб-поиска, где даже GPT-5.5 справляется лишь в 26,6% случаев.

Баннер новости 5280

Проблема: хрупкость длинных траекторий

Глубокие поисковые агенты (Deep Search Agents) решают сложные задачи через множество шагов взаимодействия с вебом. Однако этот процесс крайне нестабилен: малейшая ошибка в рассуждениях на раннем этапе может масштабироваться, превращаясь в уверенный, но неверный ответ. Ручной анализ таких длинных трасс выполнения (execution traces) часто превышает человеческие возможности.

Решение: SearchAuditBench и SearchAuditor

Команда авторов представила SearchAuditBench — первый бенчмарк, оценивающий способность LLM-аудиторов локализовать, атрибутировать и исправлять эти сбои. Датасет включает 1 243 провальную траекторию, собранных с восьми моделей с открытым весом. Каждая траектория экспертно аннотирована: выделен критический шаг ошибки, указана корневая причина и предоставлено эталонное исправление с критериями оценки.

На основе этого датасета разработан фреймворк SearchAuditor, который использует многоперспективный подход для заземленного (evidence-grounded) вынесения вердиктов. Он не просто находит ошибку, но и предлагает конкретное исправление, позволяя агенту продолжить выполнение с правильного шага.

Результаты: разрыв с базовыми моделями

Эксперименты показали, что даже самые мощные существующие модели struggles с этой задачей. Использование передовых моделей в качестве базовых решений (baselines) дает скромные результаты. В таблице ниже приведено сравнение эффективности:

Метрика / Модель Результат Примечание
Лучший Baseline (GPT-5.5) 26.6% End-to-end pass rate (сквозная успешность)
SearchAuditor 32.3% Существенное улучшение над базовыми подходами
Средняя длина траектории 73.1 сообщений В среднем на один пример в бенчмарке
Объем данных 65.1K токенов Средний размер контекста на пример

Хотя абсолютные цифры кажутся скромными, прирост с 26,6% до 32,3% в контексте сложных многошаговых рассуждений является значимым. Главное преимущество SearchAuditor — возможность возобновления (resume) провалившихся запусков агентов с помощью предложенных исправлений, что повышает общую надежность системы.

Почему это важно

По мере того как AI-агенты становятся основой для автоматизации сложных рабочих процессов, проблема «накопления ошибок» в длинных цепочках действий становится критической. SearchAuditor предлагает путь к созданию самоисправляющихся систем, снижая нагрузку на человека-оператора и повышая доверие к автономным поисковым агентам.

Источник: arXiv cs.AI ↗