Релиз модели5 октября 2026 г., 10:16 МСК🤖 Auto

DeReAct: Модульный агент с «критиком» и менеджером контекста

Исследователи представили DeReAct — архитектуру AI-агентов, разделяющую генерацию действий и их валидацию. Система повышает надежность слабых моделей, снижая количество галлюцинаций и преждевременного завершения задач.

Баннер новости 8928

Проблема монолитных агентов ReAct

Традиционные агенты на базе парадигмы ReAct (Reasoning + Acting) используют одну большую языковую модель (LLM) для всех этапов: планирования, выполнения действий и принятия решения о завершении задачи. Эта тесная связка создает критическую уязвимость: если модель ошибается в оценке контекста или предлагает недопустимое действие, ошибка распространяется дальше. Более того, модель может преждевременно заявить об успехе, даже если задача не выполнена, что делает контроль качества практически невозможным.

Архитектура DeReAct: Разделение ответственности

Авторы (Ajay Vohra, Tao Chen, Neeti Narayan, Caron Zhang) предлагают модульную архитектуру DeReAct, которая выносит две ключевые функции в отдельные «шлюзовые» политики (gating policies):

  • Critic (Критик): Внешний модуль, который валидирует предлагаемые действия до их выполнения. Это предотвращает выполнение недопустимых или опасных команд.
  • Context Manager (Менеджер контекста): Отвечает за реконструкцию состояния среды (State) и сертификацию завершения задачи. Он гарантирует, что задача считается выполненной только при наличии достаточных доказательств, поддерживаемых окружением.

Результаты бенчмарков: GAIA и SWE-bench Verified

Эксперименты показали, что DeReAct наиболее эффективен для моделей среднего и нижнего уровня («Brain models»). Введение внешнего контроля дает значительный прирост метрики Pass@1 для менее способных моделей, тогда как для топовых решений эффект сглаживается, но качество траекторий улучшается.

Модель (Brain) Бенчмарк Прирост Pass@1 (DeReAct vs ReAct) Примечание
Qwen3-Coder-480B GAIA / SWE-bench +6.5 -- 7.0 очков Значительное улучшение надежности
Claude Sonnet 4.5 GAIA / SWE-bench +4.2 -- 5.2 очков Существенный скачок точности
Claude Opus 4.5 GAIA / SWE-bench ≈ 0 (сравнимо) Равный результат, но более «заземленные» траектории

Почему это важно для индустрии

Результаты демонстрируют важный принцип: внешняя валидация критична, когда частота целевых сбоев высока. Для слабых моделей DeReAct работает как «костыль», исправляющий фундаментальные ошибки рассуждений. Для сильных моделей (как Claude Opus 4.5) прирост в абсолютных баллах невелик, но анализ траекторий показывает, что DeReAct генерирует более полные доказательства и лучше соблюдает ограничения, жертвуя скоростью ради достоверности. Это открывает путь к созданию автономных систем, где безопасность и проверяемость решений важнее максимальной скорости реакции.

Бенчмарки

БенчмаркClaude Sonnet 4.5Qwen3-Coder-480B
SWE-bench Verified5.2%7%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: arXiv cs.AI ↗