Исследования18 августа 2026 г., 07:21 МСК🤖 Auto

Эффект снежного кома галлюцинаций: почему верификация в конце пайплайна бесполезна

Исследование ICML 2026 показывает, что в многоагентных LLM-системах ошибки не просто копируются, а трансформируются, становясь неразличимыми. Проверка на границах этапов снижает выживание галлюцинаций с 58,4% до 16,2%.

Баннер новости 5968

Структурный дефект многоагентных систем

Исследователи Prabhjot Singh и Bhushan Pawar из работы, принятой на воркшоп FAGEN (ICML 2026), выявили критический недостаток последовательных многоагентных пайплайнов: отсутствие верификации на этапах передачи данных (handoffs). Ошибка, внесенная на первом этапе, не просто сохраняется, а проходит через процесс трансформации, который авторы назвали «эффектом снежного кома галлюцинаций» (Hallucination Snowball Effect). Этот процесс моделируется как марковский процесс первого порядка с четырьмя состояниями, где каждый переход снижает вероятность обнаружения ошибки.

Математика невидимости: от факта к выводу

Галлюцинация проходит четыре стадии: Исходный факт → Производное вычисление → Нарративный текст → Редакционно утвержденный вывод. На каждом этапе детектируемость падает экспоненциально. Исследование на базе датасета FinanceBench с использованием 346 автоматически внедренных галлюцинаций в 4-агентном пайплайне показало катастрофический рост «невидимости» ошибок:

Этап (Состояние) Вероятность «побег» ошибки (Escape Probability) Доля обнаружения (gpt-4o)
Stage 1 (Raw Fact) 24,6% 72,0%
Stage 2 (Derived) 48,3%
Stage 3 (Narrative)
Stage 4 (Invisible) 89,3% 50,9%

В итоговом выводе 23,7% галлюцинаций остаются полностью незамеченными. Даже самая мощная из протестированных моделей — Qwen3.5-397B-A17B (показавшая 87,0% обнаружения на Stage 1) — имеет структурный потолок: прогнозируемое обнаружение на Stage 4 составляет лишь ~60–65%.

Ключевой инсайт: когда проверять важнее, чем проверять

Главный вывод статьи заключается в сравнении стратегий верификации. Использование границ (boundary gates) с инструментами RAG-верификации на каждом этапе снижает долю выживших галлюцинаций с 58,4% до 16,2% по сравнению с проверкой только в конце пайплайна. Статистическая значимость разницы огромна (Cohen's h = -0.911, p < 0.000001). Проверка только в конце дает прирост всего в 2,3 процентных пункта.

Авторы рекомендуют инвестировать ресурсы в верификацию на границе S1→S2, так как именно там 75,4% галлюцинаций еще можно поймать, в то время как на границе S3→S4 уже 89,3% ошибок «сбежали» в формат, непригодный для автоматического обнаружения.

Источник: arXiv cs.AI ↗