Исследования17 июля 2026 г., 02:19 МСК🤖 Auto

OpenRCA: Почему LLM проваливают RCA в продакшене

Исследование на датасете OpenRCA показало, что даже мощные LLM не могут надежно находить первопричины сбоев в микросервисах. Главная проблема — не в данных, а в логическом выводе моделей.

Баннер новости 3771

Провал существующих подходов

Авторы работы Athira Gopal и Ashwanth Krishnan провели стресс-тест для систем Root Cause Analysis (RCA) на реальном наборе данных OpenRCA. Это мультимодальный датасет, содержащий метрики, логи и трейсы, характерные для сложных микросервисных архитектур. Результаты оказались разочаровывающими: как классические методы каузального вывода, так и современные многоагентные LLM-системы демонстрируют стабильно низкую точность.

Новая архитектура Structured Multi-Agent

Для решения проблемы исследователи разработали конвейер Structured Multi-Agent RCA. Архитектура поддерживает два режима работы: с доменной экспертизой и без нее. Ключевым нововведением стал агент reverse reasoning (обратного рассуждения). Он анализирует правильные ответы, чтобы определить, какие именно сигналы аномалий должны были быть использованы, и классифицирует сбой по одной из двух причин:

  • Reasoning Gap: необходимые доказательства есть в данных, но модель их проигнорировала.
  • Data Ambiguity: необходимых доказательств в данных физически отсутствует.

Главный инсайт: проблема в «мышлении», а не в данных

Анализ показал, что в подавляющем большинстве случаев проблема кроется в Reasoning Gap. То есть, модель просто не способна корректно связать имеющиеся аномалии с причиной сбоя. Это означает, что улучшение пайплайнов сбора данных или «скелетная» инженерия (scaffold engineering) не решат проблему — требуется апгрейд самих языковых моделей.

Автоматизация правил

Авторы также внедрили пайплайн автоматического извлечения правил (rule mining) из отчетов обратного рассуждения. Это позволяет снизить зависимость от ручной курирования знаний. Эксперименты подтвердили: чем сильнее модель, тем больше доменной экспертизы она способна встроить в процесс, а явное внедрение знаний частично компенсирует этот разрыв.

Сравнение эффективности

Метод/Подход Результат на OpenRCA Ключевое ограничение
Классические методы каузального вывода Низкая точность Не справляются с мультимодальностью
Существующие LLM Multi-Agent Низкая точность Reasoning Gap (игнорирование сигналов)
Structured Multi-Agent RCA (предложенный) Значительно выше базовых Зависит от силы базовой LLM

Вывод исследования однозначен: для прорыва в автоматизированном RCA необходимы улучшения на уровне архитектуры самих моделей, а не просто оптимизация входных данных.

Источник: arXiv cs.AI ↗