Проблема: хрупкость длинных траекторий
Глубокие поисковые агенты (Deep Search Agents) решают сложные задачи через множество шагов взаимодействия с вебом. Однако этот процесс крайне нестабилен: малейшая ошибка в рассуждениях на раннем этапе может масштабироваться, превращаясь в уверенный, но неверный ответ. Ручной анализ таких длинных трасс выполнения (execution traces) часто превышает человеческие возможности.
Решение: SearchAuditBench и SearchAuditor
Команда авторов представила SearchAuditBench — первый бенчмарк, оценивающий способность LLM-аудиторов локализовать, атрибутировать и исправлять эти сбои. Датасет включает 1 243 провальную траекторию, собранных с восьми моделей с открытым весом. Каждая траектория экспертно аннотирована: выделен критический шаг ошибки, указана корневая причина и предоставлено эталонное исправление с критериями оценки.
На основе этого датасета разработан фреймворк SearchAuditor, который использует многоперспективный подход для заземленного (evidence-grounded) вынесения вердиктов. Он не просто находит ошибку, но и предлагает конкретное исправление, позволяя агенту продолжить выполнение с правильного шага.
Результаты: разрыв с базовыми моделями
Эксперименты показали, что даже самые мощные существующие модели struggles с этой задачей. Использование передовых моделей в качестве базовых решений (baselines) дает скромные результаты. В таблице ниже приведено сравнение эффективности:
| Метрика / Модель | Результат | Примечание |
|---|---|---|
| Лучший Baseline (GPT-5.5) | 26.6% | End-to-end pass rate (сквозная успешность) |
| SearchAuditor | 32.3% | Существенное улучшение над базовыми подходами |
| Средняя длина траектории | 73.1 сообщений | В среднем на один пример в бенчмарке |
| Объем данных | 65.1K токенов | Средний размер контекста на пример |
Хотя абсолютные цифры кажутся скромными, прирост с 26,6% до 32,3% в контексте сложных многошаговых рассуждений является значимым. Главное преимущество SearchAuditor — возможность возобновления (resume) провалившихся запусков агентов с помощью предложенных исправлений, что повышает общую надежность системы.
Почему это важно
По мере того как AI-агенты становятся основой для автоматизации сложных рабочих процессов, проблема «накопления ошибок» в длинных цепочках действий становится критической. SearchAuditor предлагает путь к созданию самоисправляющихся систем, снижая нагрузку на человека-оператора и повышая доверие к автономным поисковым агентам.
Источник: arXiv cs.AI ↗
