Проблема монолитных агентов ReAct
Традиционные агенты на базе парадигмы ReAct (Reasoning + Acting) используют одну большую языковую модель (LLM) для всех этапов: планирования, выполнения действий и принятия решения о завершении задачи. Эта тесная связка создает критическую уязвимость: если модель ошибается в оценке контекста или предлагает недопустимое действие, ошибка распространяется дальше. Более того, модель может преждевременно заявить об успехе, даже если задача не выполнена, что делает контроль качества практически невозможным.
Архитектура DeReAct: Разделение ответственности
Авторы (Ajay Vohra, Tao Chen, Neeti Narayan, Caron Zhang) предлагают модульную архитектуру DeReAct, которая выносит две ключевые функции в отдельные «шлюзовые» политики (gating policies):
- Critic (Критик): Внешний модуль, который валидирует предлагаемые действия до их выполнения. Это предотвращает выполнение недопустимых или опасных команд.
- Context Manager (Менеджер контекста): Отвечает за реконструкцию состояния среды (State) и сертификацию завершения задачи. Он гарантирует, что задача считается выполненной только при наличии достаточных доказательств, поддерживаемых окружением.
Результаты бенчмарков: GAIA и SWE-bench Verified
Эксперименты показали, что DeReAct наиболее эффективен для моделей среднего и нижнего уровня («Brain models»). Введение внешнего контроля дает значительный прирост метрики Pass@1 для менее способных моделей, тогда как для топовых решений эффект сглаживается, но качество траекторий улучшается.
| Модель (Brain) | Бенчмарк | Прирост Pass@1 (DeReAct vs ReAct) | Примечание |
|---|---|---|---|
| Qwen3-Coder-480B | GAIA / SWE-bench | +6.5 -- 7.0 очков | Значительное улучшение надежности |
| Claude Sonnet 4.5 | GAIA / SWE-bench | +4.2 -- 5.2 очков | Существенный скачок точности |
| Claude Opus 4.5 | GAIA / SWE-bench | ≈ 0 (сравнимо) | Равный результат, но более «заземленные» траектории |
Почему это важно для индустрии
Результаты демонстрируют важный принцип: внешняя валидация критична, когда частота целевых сбоев высока. Для слабых моделей DeReAct работает как «костыль», исправляющий фундаментальные ошибки рассуждений. Для сильных моделей (как Claude Opus 4.5) прирост в абсолютных баллах невелик, но анализ траекторий показывает, что DeReAct генерирует более полные доказательства и лучше соблюдает ограничения, жертвуя скоростью ради достоверности. Это открывает путь к созданию автономных систем, где безопасность и проверяемость решений важнее максимальной скорости реакции.
Бенчмарки
| Бенчмарк | Claude Sonnet 4.5 | Qwen3-Coder-480B |
|---|---|---|
| SWE-bench Verified | 5.2% | 7% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: arXiv cs.AI ↗
