Главная/Блог/Гайд/TRACE: Как Stanford превращает провалы…
Гайд4 мин чтения · 13 июля 2026 г.

TRACE: Как Stanford превращает провалы агентов в навыки

Исследователи из Стэнфорда представили TRACE — систему, которая диагностирует провалы AI-агентов и обучает их на основе конкретных недостающих навыков, а не общих ошибок.

TRACE: Как Stanford превращает провалы агентов в навыки

В мире автономных AI-агентов (Agentic AI) существует одна фундаментальная проблема, которая тормозит их массовое внедрение в критически важные задачи. Агенты часто терпят неудачу по одним и тем же причинам, повторяя одни и те же ошибки снова и снова. Это не случайный шум, а системный сбой архитектуры или обучения. Традиционные подходы, такие как прямое обучение с подкреплением (Direct RL) или обучение с учителем (SFT), часто тратят вычислительные ресурсы впустую, предоставляя агенту разреженные награды, которые не говорят ему, какой именно навык был упущен. Широкая генерация синтетических данных также неэффективна, так как бюджет уходит на оттачивание уже имеющихся у модели компетенций, а не на закрытие пробелов.

Команда исследователей из Стэнфордского университета предлагает революционное решение. Они представили систему под названием TRACE (Turning Recurrent Agent Failures into Capability-Targeted Training Environments). Эта система не просто исправляет ошибки постфактум; она диагностирует недостающие способности агента, создает для каждой из них специализированную среду обучения и обучает модель точечно. TRACE выпущена с открытым исходным кодом под лицензией MIT, что делает передовые методы оптимизации доступными для широкого круга разработчиков.

Схема работы системы TRACE: от анализа провалов до обучения адаптеров
Схема работы системы TRACE: от анализа провалов до обучения адаптеров

01Почему агенты терпят неудачу: проблема «слепых зон»

Чтобы понять дизайн TRACE, нужно сначала разобраться в природе провалов агентов. Агенты на базе больших языковых моделей (LLM) часто не справляются с задачами не из-за общей «глупости» модели, а из-за отсутствия конкретных, узкоспециализированных навыков. Например, агент может не уметь правильно извлекать нужную запись из базы данных или проверять предварительные условия перед выполнением действия. Эти навыки кажутся простыми, но в контексте сложных многошаговых сценариев их отсутствие приводит к полному краху задачи.

Существует два основных подхода к исправлению этих ошибок, и оба они имеют серьезные недостатки:

  1. Прямое обучение с подкреплением (RL) или SFT: Эти методы дают агенту награду за успешное выполнение задачи в целом. Однако награда слишком разрежена. Агент не понимает, какой именно шаг был выполнен неверно. Была ли ошибка в логике, в вызове инструмента или в обработке данных? Без детальной обратной связи модель учится методом проб и ошибок, что требует огромных объемов данных и вычислительной мощности.
  2. Широкая синтетическая генерация данных: Создание большого объема случайных данных для обучения часто приводит к тому, что модель продолжает тренироваться на том, что она уже умеет делать хорошо. Ресурсы тратятся на усиление сильных сторон, в то время как слабые места остаются незакрытыми. Это неэффективное распределение бюджета на обучение.

TRACE исходит из гипотезы, что провалы агентов не случайны. Исследования показывают, что небольшой набор дефицитов (недостающих навыков) объясняет большинство неудачных траекторий. Следовательно, каждый повторяющийся дефицит может стать собственным плотным, верифицируемым сигналом для обучения. Вместо того чтобы учить модель всему сразу, TRACE учит её тому, чего ей не хватает.

💡
Ключевая идея. TRACE рассматривает провалы не как ошибки, а как данные для обучения. Каждый неудачный сценарий — это указание на конкретный недостающий навык, который можно изолировать и отработать.

02Как работает TRACE: четырехэтапный конвейер

TRACE реализует автоматизированный конвейер из четырех шагов. Каждый шаг управляется агентом на базе LLM, который следует маркдаун-промптам. Этот процесс позволяет полностью автоматизировать диагностику и обучение без необходимости ручной разметки данных.

Шаг 1: Контрастивный анализ способностей

На первом этапе базовый агент генерирует траектории (rollouts) в целевой среде. Затем агент-аналитик разделяет эти траектории на успешные и неудачные. Он помечает каждую пару «траектория-способность» как NA (не применимо), PRESENT (присутствует) или LACKING (отсутствует).

TRACE: Как Stanford превращает провалы агентов в навыки

Способность сохраняется для дальнейшего обучения только если она является контрастивной и имеет высокое покрытие. Конкретно, ее контрастный разрыв (delta, δ) должен быть не менее 0.20, а покрытие (rho, ρ) — не менее 0.10. Это означает, что способность должна четко разделять успешные и неудачные сценарии и присутствовать в значительной части провалов. Таким образом, пайплайн отбирает навыки, отсутствие которых концентрируется именно в неудачных попытках.

Шаг 2: Синтез целевых сред

После того как дефициты выявлены, агент генерации создает одну синтетическую среду для каждой сохраненной способности. Каждая такая среда изолирует один конкретный навык, сохраняя при этом схемы инструментов и форматы данных целевой задачи.

Экземпляры задач генерируются процедурно из случайных семян (seeds). Поскольку генерация и проверка результатов являются алгоритмическими, награды не требуют человеческой разметки или оценки через LLM-судью. Это делает процесс верификации быстрым, дешевым и масштабируемым.

Шаг 3: Обучение адаптеров способностей

Для каждой способности создается и обучается отдельный адаптер LoRA (Low-Rank Adaptation). Алгоритм обучения — GRPO (Group Relative Policy Optimization). Важно отметить, что базовая модель остается замороженной (frozen) на протяжении всего процесса. GRPO группирует траектории по общему семени, поэтому сценарии внутри группы идентичны. Награды нормализуются внутри каждой группы, чтобы изолировать вклад политики модели.

Шаг 4: Составление MoE с маршрутизацией на уровне токенов

На финальном этапе TRACE объединяет все адаптеры в модель Mixture-of-Experts (MoE). Бэкбон и адаптеры остаются замороженными, обучаются только легкие вратарские механизмы (gates) на уровне токенов. При выводе (inference) каждый токен маршрутизируется к одному адаптеру способности. Это позволяет модели переключать экспертов в середине траектории.

Источник: MarkTechPost ↗