Исследования7 августа 2026 г., 13:17 МСК🤖 Auto

OrchestraBench: Почему мультиагентные системы проваливаются и как это измерить

Исследователи представили OrchestraBench — первый бенчмарк, оценивающий не точность, а устойчивость мультиагентных систем к сбоям, каскадным отказам и качеству декомпозиции задач.

Баннер новости 5296

Проблема «черного ящика» в мультиагентных пайплайнах

По мере перехода мультиагентных оркестрационных фреймворков из демо-режима в продакшен, индустрия столкнулась с критическим пробелом: существующие бенчмарки сообщают лишь об успешности задачи, игнорируя причины провалов. Исследователи из команды Yidian Chen, Yingzi Gu и других разработали OrchestraBench — инструмент для контролируемого анализа режимов отказа, восстановления и качества декомпозиции. В отличие от стандартных метрик, OrchestraBench использует механизм инъекции сбоев с воспроизводимыми сеeds, позволяя точно определить, где начинается каскад ошибок и какое решение маршрутизации привело к коллапсу.

Ключевые метрики: радиус каскада и восстановление

Основой оценки стали две новые метрики: cascade radius (радиус каскада) и способность системы к восстановлению после конкретных типов сбоев. Исследование показало, что радиус каскада напрямую зависит от глубины пайплайна: при увеличении глубины с 3 до 7 уровней средний радиус роста ошибок возрастает с 0.9 до 4.7. Это означает, что каждая дополнительная ступень в цепочке агентов экспоненциально увеличивает риск распространения ошибки на всю систему.

Сравнение политик маршрутизации: ключи против намерений

Одним из самых интригующих результатов стало сравнение простых маршрутизаторов на основе ключевых слов/флагов и моделей, использующих рассуждение о намерениях (intent-reasoning). На наборе из 26 случаев с золотым стандартом диагностики, простой router показал 0% точность на адверсариальных случаях с вводящими в заблуждение или отсутствующими поверхностными флагами. В то же время router на базе модели с рассуждением достиг 100% точности, сопоставимой с оракулом.

Тип сбоя (MAST mode) Уровень восстановления Характеристика
Tool faults (сбои инструментов) 1.0 (Полное) Система успешно справляется с техническими ошибками внешних инструментов.
Ambiguous delegation (двусмысленная делегация) 0.30 (Частичное) Система лишь частично восстанавливается при неясном распределении задач.
Latent/Semantic modes (скрытые/семантические) 0.0 (Отсутствует) Три режима латентных или семантических сбоев не поддаются восстановлению.

Ловушка «слепой» повторной попытки

Исследование выявило опасный паттерн поведения: blind retry (слепая повторная попытка без диагностики) не только не исправляла латентные сбои, но и увеличивала время до их обнаружения. Это подчеркивает, что для сдерживания ошибок необходимы механизмы детекции и атрибуции, а не просто автоматический рестарт. Кроме того, абляция с «доверенным состоянием» показала, что кажущееся улучшение контроля часто обеспечивается не автономным обнаружением ошибок агентами, а внешним сигналом доверенного состояния.

Стабильность результатов across моделей

Эксперименты с реальными агентами Claude (Sonnet, Opus, Haiku) и переформулированием задачи в рабочий процесс одобрения кредитов подтвердили устойчивость иерархии отказов. Хотя абсолютные показатели восстановления менялись в зависимости от контекста, порядок уязвимостей (инструменты > делегация > семантика) оставался неизменным. Это указывает на фундаментальные архитектурные ограничения современных мультиагентных систем, которые необходимо учитывать при проектировании промышленных решений.

Источник: arXiv cs.AI ↗