Проблема: агенты повторяют одни и те же ошибки
Агентные LLM-системы часто терпят неудачу из-за отсутствия конкретных навыков, а не из-за общей «глупости» модели. Традиционные методы, такие как прямой RL или SFT, тратят вычислительные ресурсы впустую, так как награды слишком разрежены, а синтетические данные нецелевые. Стэнфордская команда разработала TRACE (Turning Recurrent Agent Failures into Capability-targeted training Environments), которая диагностирует эти пробелы и обучает модель точечно.
Как работает TRACE: 4 шага к мастерству
Система использует автоматизированный пайплайн, управляемый LLM-агентами:
- Шаг 1: Контрастный анализ. Трассировка разбивает траектории на успешные и проваленные. Оставляются только те навыки, где разрыв в эффективности (Δ) ≥ 0.20, а покрытие провалов (Cov) ≥ 0.10.
- Шаг 2: Синтез сред. Для каждого выявленного дефицита создается отдельная синтетическая среда с процедурной генерацией задач. Награды верифицируются алгоритмически, без участия человека.
- Шаг 3: Обучение адаптеров. Каждый навык получает свой LoRA-адаптер, обученный через GRPO (Group Relative Policy Optimization). Базовая модель замораживается.
- Шаг 4: MoE-композиция. Адаптеры объединяются в Mixture-of-Experts. На этапе инференса каждый токен маршрутизируется к одному эксперту (top-1 routing), что позволяет модели переключать навыки в реальном времени.
Результаты: обгоняем промпт-инжиниринг и RL
На бенчмарке τ²-Bench (сервисные задачи) и SWE-bench Verified (кодинг) TRACE демонстрирует значительный прирост по сравнению с базовыми моделями и методами оптимизации промптов (GEPA). Особенно впечатляющие результаты показала модель Qwen3-30B-A3B.
| Метод | τ²-Bench (Overall %) | SWE-bench Verified (Pass@1 %) |
|---|---|---|
| Base (Qwen3-30B-A3B) | 32.9% | 26.0% |
| GEPA (Prompt Opt.) | 39.6% | 31.0% |
| Single Cap. GRPO | 40.3% | 36.6% |
| TRACE (Ours) | 48.2% | 41.0% |
На модели Qwen3.6-27B TRACE достигла 73.2% Pass@1 на SWE-bench Verified, превзойдя в публичном лидерборде GPT-5.2-Codex (72.8%), GLM 5 и Claude 4.5 Sonnet. При этом система оказалась более sample-efficient: используя менее четверти траекторий, она превзошла финальные результаты GRPO и GEPA.
Почему это важно
TRACE доказывает, что повторные провалы агентов — это не шум, а сигнал. Выделяя конкретные дефициты (например, «проверка предусловий» или «точность вызова инструментов»), система создает плотные обучающие сигналы. Код проекта доступен под лицензией MIT, что делает его доступным для внедрения в агентные инфраструктуры.
Источник: MarkTechPost ↗
