Исследования13 июля 2026 г., 14:16 МСК🤖 Auto

TRACE от Stanford: как агенты учатся на своих ошибках

Исследователи из Стэнфорда представили TRACE — систему, которая превращает повторяющиеся провалы AI-агентов в целевые тренировочные среды, повышая точность на 15+ пунктов.

Баннер новости 3452

Проблема: агенты повторяют одни и те же ошибки

Агентные LLM-системы часто терпят неудачу из-за отсутствия конкретных навыков, а не из-за общей «глупости» модели. Традиционные методы, такие как прямой RL или SFT, тратят вычислительные ресурсы впустую, так как награды слишком разрежены, а синтетические данные нецелевые. Стэнфордская команда разработала TRACE (Turning Recurrent Agent Failures into Capability-targeted training Environments), которая диагностирует эти пробелы и обучает модель точечно.

Как работает TRACE: 4 шага к мастерству

Система использует автоматизированный пайплайн, управляемый LLM-агентами:

  • Шаг 1: Контрастный анализ. Трассировка разбивает траектории на успешные и проваленные. Оставляются только те навыки, где разрыв в эффективности (Δ) ≥ 0.20, а покрытие провалов (Cov) ≥ 0.10.
  • Шаг 2: Синтез сред. Для каждого выявленного дефицита создается отдельная синтетическая среда с процедурной генерацией задач. Награды верифицируются алгоритмически, без участия человека.
  • Шаг 3: Обучение адаптеров. Каждый навык получает свой LoRA-адаптер, обученный через GRPO (Group Relative Policy Optimization). Базовая модель замораживается.
  • Шаг 4: MoE-композиция. Адаптеры объединяются в Mixture-of-Experts. На этапе инференса каждый токен маршрутизируется к одному эксперту (top-1 routing), что позволяет модели переключать навыки в реальном времени.

Результаты: обгоняем промпт-инжиниринг и RL

На бенчмарке τ²-Bench (сервисные задачи) и SWE-bench Verified (кодинг) TRACE демонстрирует значительный прирост по сравнению с базовыми моделями и методами оптимизации промптов (GEPA). Особенно впечатляющие результаты показала модель Qwen3-30B-A3B.

Метод τ²-Bench (Overall %) SWE-bench Verified (Pass@1 %)
Base (Qwen3-30B-A3B) 32.9% 26.0%
GEPA (Prompt Opt.) 39.6% 31.0%
Single Cap. GRPO 40.3% 36.6%
TRACE (Ours) 48.2% 41.0%

На модели Qwen3.6-27B TRACE достигла 73.2% Pass@1 на SWE-bench Verified, превзойдя в публичном лидерборде GPT-5.2-Codex (72.8%), GLM 5 и Claude 4.5 Sonnet. При этом система оказалась более sample-efficient: используя менее четверти траекторий, она превзошла финальные результаты GRPO и GEPA.

Почему это важно

TRACE доказывает, что повторные провалы агентов — это не шум, а сигнал. Выделяя конкретные дефициты (например, «проверка предусловий» или «точность вызова инструментов»), система создает плотные обучающие сигналы. Код проекта доступен под лицензией MIT, что делает его доступным для внедрения в агентные инфраструктуры.

Источник: MarkTechPost ↗