Проблема: «Однострочный» диагноз не работает
С ростом сложности AI-агентов их выполнение генерирует огромные объемы логов. Традиционные методы автоматического атрибуции первопричин (RCA) используют LLM для однократного анализа траектории. Однако в длинных сценариях (long-horizon) релевантная информация разрознена. Модель склонна делать вывод на основе первых доступных улик, игнорируя критические детали, скрытые в конце цепочки действий. Это превращает диагностику в задачу поиска по огромному пространству данных, где стандартные подходы дают сбой.
Решение: Итеративный поиск (Continual Search)
Авторы предлагают фреймворк Continual Search. Вместо одного запроса система заставляет модель-судью (judge) проходить через несколько раундов. На каждом шаге алгоритм «подталкивает» LLM искать доказательства, которые еще не были рассмотрены. Это позволяет выявить причинно-следственные связи, разбросанные по разным частям лога, и отсеять ложные срабатывания.
Новый бенчмарк: MegaRCA-Mix
Существующие тесты не отражают масштаб реальных задач. Авторы создали MegaRCA-Mix — набор данных из 50 аннотированных вручную сценариев с длинными, ресурсоемкими траекториями. Это позволяет оценить способность моделей работать с большими объемами контекста и редкими сигналами об ошибках.
Результаты: Качество важнее размера модели
Метод Continual Search демонстрирует стабильный прирост метрик F1 на всех протестированных моделях. Особенно показательно, что улучшенная методика позволяет моделям среднего уровня превосходить флагманы, если последние работают в режиме «одного вызова».
| Модель | Базовая F1 (One-shot) | F1 с Continual Search | Прирост |
|---|---|---|---|
| GPT-5.5 | 0.349 | 0.498 | +40%+ |
| Примечание: В рамках семейств моделей более слабые модели с Continual Search часто обгоняют более сильные базовые версии. | |||
Почему это важно
Результаты доказывают, что эффективный алгоритмический поиск (search) может компенсировать нехватку «сырой» вычислительной мощности или параметров модели. Для индустрии это означает, что отладка сложных автономных систем может стать дешевле и надежнее без необходимости постоянно масштабировать сами LLM.
Источник: arXiv cs.AI ↗
