Проблема: тупик в обучении автономных агентов
Параллельно с развитием LLM, индустрия столкнулась с критическим дефицитом качественных интерактивных сред для обучения агентов (Agentic RL). Существующие синтетические среды ограничиваются лишь вызовом инструментов (tool-calling), что недостаточно для сложных сценариев, где агент должен работать в состоятельных рабочих пространствах (stateful workspaces) и выполнять задачи с длинным горизонтом планирования. Это создает «бутылочное горлышко» для масштабирования автономных систем.
Решение: EnvCraft и два движка синтеза
Команда авторов (Yirong Zeng, Shen You и др.) представила EnvCraft — автоматизированный фреймворк, который генерирует как сами среды, так и данные для их обучения. Архитектура включает два ключевых компонента:
- Environment Synthesis Engine: создает изолированные песочницы (sandbox-isolated workspaces), имитирующие реальные условия.
- Topology-aware Data Generation Engine: генерирует связные траектории задач, учитывая топологию среды, чтобы обеспечить логическую целостность действий агента.
Масштаб данных и результаты
Исследователи синтезировали 139 уникальных интерактивных сред, содержащих около 20 000 сложных задач. Тестирование проводилось на моделях Qwen3 и Qwen3.5 (размеры 8B и 32B). Метод показал значительное улучшение метрик по сравнению с базовыми линиями, особенно в задачах, требующих длительного взаимодействия.
| Метрика / Модель | Результат улучшения | Примечание |
|---|---|---|
| Claw-style benchmarks (Qwen3/3.5) | +11.9% | Рост точности в сложных задачах с длинным горизонтом |
| General tool-use benchmarks | +8.0% | Улучшение в общих задачах использования инструментов |
| Стоимость инференса | Снижение | Одновременное уменьшение количества токенов на запрос |
Почему это важно
Результаты подтверждают, что синтезированные исполняемые среды предоставляют robust (устойчивые) и обобщаемые сигналы обучения. Это позволяет обучать агентов не просто «отвечать на вопросы», а эффективно действовать в сложных, многошаговых сценариях, приближая их к реальным требованиям индустрии. Снижение стоимости инференса делает такой подход экономически выгодным для массового внедрения.
Источник: arXiv cs.AI ↗
