Структурный дефект многоагентных систем
Исследователи Prabhjot Singh и Bhushan Pawar из работы, принятой на воркшоп FAGEN (ICML 2026), выявили критический недостаток последовательных многоагентных пайплайнов: отсутствие верификации на этапах передачи данных (handoffs). Ошибка, внесенная на первом этапе, не просто сохраняется, а проходит через процесс трансформации, который авторы назвали «эффектом снежного кома галлюцинаций» (Hallucination Snowball Effect). Этот процесс моделируется как марковский процесс первого порядка с четырьмя состояниями, где каждый переход снижает вероятность обнаружения ошибки.
Математика невидимости: от факта к выводу
Галлюцинация проходит четыре стадии: Исходный факт → Производное вычисление → Нарративный текст → Редакционно утвержденный вывод. На каждом этапе детектируемость падает экспоненциально. Исследование на базе датасета FinanceBench с использованием 346 автоматически внедренных галлюцинаций в 4-агентном пайплайне показало катастрофический рост «невидимости» ошибок:
| Этап (Состояние) | Вероятность «побег» ошибки (Escape Probability) | Доля обнаружения (gpt-4o) |
|---|---|---|
| Stage 1 (Raw Fact) | 24,6% | 72,0% |
| Stage 2 (Derived) | 48,3% | — |
| Stage 3 (Narrative) | — | — |
| Stage 4 (Invisible) | 89,3% | 50,9% |
В итоговом выводе 23,7% галлюцинаций остаются полностью незамеченными. Даже самая мощная из протестированных моделей — Qwen3.5-397B-A17B (показавшая 87,0% обнаружения на Stage 1) — имеет структурный потолок: прогнозируемое обнаружение на Stage 4 составляет лишь ~60–65%.
Ключевой инсайт: когда проверять важнее, чем проверять
Главный вывод статьи заключается в сравнении стратегий верификации. Использование границ (boundary gates) с инструментами RAG-верификации на каждом этапе снижает долю выживших галлюцинаций с 58,4% до 16,2% по сравнению с проверкой только в конце пайплайна. Статистическая значимость разницы огромна (Cohen's h = -0.911, p < 0.000001). Проверка только в конце дает прирост всего в 2,3 процентных пункта.
Авторы рекомендуют инвестировать ресурсы в верификацию на границе S1→S2, так как именно там 75,4% галлюцинаций еще можно поймать, в то время как на границе S3→S4 уже 89,3% ошибок «сбежали» в формат, непригодный для автоматического обнаружения.
Источник: arXiv cs.AI ↗
