Исследования20 июля 2026 г., 08:17 МСК🤖 Auto

Точность ревьюера не спасает: почему критика не исправляет ошибки LLM

Исследование arXiv 2026 года показывает, что высокая точность обнаружения ошибок в многоагентных системах не гарантирует исправления. Модель может идеально находить баги, но игнорировать советы по их устранению.

Баннер новости 3924

Разрыв между обнаружением и исправлением

Команда исследователей под руководством Чих-Хсуана Яна (Chih-Hsuan Yang) проанализировала 4 181 задачу из набора данных Omni-MATH, используя модель gpt-oss-120b. Целью было проверить гипотезу: наличие специализированного агента-ревьюера в иерархической архитектуре действительно повышает итоговую точность решения сложных математических задач.

Результаты оказались парадоксальными. На простых задачах (уровни 1–3) добавление ревьюера почти не дает прироста. Однако на сложных задачах (уровень 4+) возникает разрыв: архитектура с «широковещательным» обсуждением (broadcast-style) превосходит классический конвейер «Планировщик-Исполнитель-Ревьюер» (PER). При этом ревьюер в системе PER оказывается значительно точнее, чем в системе с обсуждением.

Ключевые метрики: точность vs. принятие критики

Главный вывод статьи: качество обнаружения ошибок (precision) и способность системы использовать критику для исправления ответа (critique uptake) — это два независимых показателя. Система может быть «точным, но оторванным» (precise but uncoupled) агентом.

Метрика Архитектура PER (с ревьюером) Архитектура Broadcast (обсуждение) Интерпретация
Точность ревьюера (Reviewer Precision) 0.861 0.644 PER-ревьюер лучше находит ошибки
Полезность критики (Evaluator-verified useful critique) Низкая вероятность изменения ответа Выше Критика в PER реже приводит к исправлению
Итоговая точность (Tier 4+) Ниже Выше Лучшее обнаружение не дало лучшего результата

Почему это важно для разработчиков AI

Исследование выявило критическую проблему в оценке многоагентных систем: фокус на качестве детекции ошибок (reviewer detection quality) может искусственно завышать оценку эффективности всей системы. Протокол может отлично находить ошибки, но если он не может «договориться» с исполнителем об их исправлении, итоговый результат будет низким.

Эксперименты показали, что принудительное явное подтверждение критики (forcing explicit acknowledgment) внутри архитектуры PER даже снижает итоговую точность. Частичное улучшение достигается только при прямом внедрении рекомендаций ревьюера в контекст работы исполнителя, однако это не позволяет полностью сократить разрыв с методом широковещательного обсуждения.

Вывод

Для создания надежных математических агентов недостаточно просто добавить «умного критика». Необходимо решать проблему critique uptake — механизмов, которые гарантируют, что найденная ошибка будет не просто зафиксирована, а интегрирована в следующий шаг решения. Архитектуры, основанные на жесткой иерархии, могут проигрывать более гибким моделям коллективного обсуждения именно из-за потери информации на этапе «передачи» критики.

Источник: arXiv cs.AI ↗