Провал существующих подходов
Авторы работы Athira Gopal и Ashwanth Krishnan провели стресс-тест для систем Root Cause Analysis (RCA) на реальном наборе данных OpenRCA. Это мультимодальный датасет, содержащий метрики, логи и трейсы, характерные для сложных микросервисных архитектур. Результаты оказались разочаровывающими: как классические методы каузального вывода, так и современные многоагентные LLM-системы демонстрируют стабильно низкую точность.
Новая архитектура Structured Multi-Agent
Для решения проблемы исследователи разработали конвейер Structured Multi-Agent RCA. Архитектура поддерживает два режима работы: с доменной экспертизой и без нее. Ключевым нововведением стал агент reverse reasoning (обратного рассуждения). Он анализирует правильные ответы, чтобы определить, какие именно сигналы аномалий должны были быть использованы, и классифицирует сбой по одной из двух причин:
- Reasoning Gap: необходимые доказательства есть в данных, но модель их проигнорировала.
- Data Ambiguity: необходимых доказательств в данных физически отсутствует.
Главный инсайт: проблема в «мышлении», а не в данных
Анализ показал, что в подавляющем большинстве случаев проблема кроется в Reasoning Gap. То есть, модель просто не способна корректно связать имеющиеся аномалии с причиной сбоя. Это означает, что улучшение пайплайнов сбора данных или «скелетная» инженерия (scaffold engineering) не решат проблему — требуется апгрейд самих языковых моделей.
Автоматизация правил
Авторы также внедрили пайплайн автоматического извлечения правил (rule mining) из отчетов обратного рассуждения. Это позволяет снизить зависимость от ручной курирования знаний. Эксперименты подтвердили: чем сильнее модель, тем больше доменной экспертизы она способна встроить в процесс, а явное внедрение знаний частично компенсирует этот разрыв.
Сравнение эффективности
| Метод/Подход | Результат на OpenRCA | Ключевое ограничение |
|---|---|---|
| Классические методы каузального вывода | Низкая точность | Не справляются с мультимодальностью |
| Существующие LLM Multi-Agent | Низкая точность | Reasoning Gap (игнорирование сигналов) |
| Structured Multi-Agent RCA (предложенный) | Значительно выше базовых | Зависит от силы базовой LLM |
Вывод исследования однозначен: для прорыва в автоматизированном RCA необходимы улучшения на уровне архитектуры самих моделей, а не просто оптимизация входных данных.
Источник: arXiv cs.AI ↗
