Исследования10 сентября 2026 г., 14:19 МСК🤖 Auto

EnvCraft: Как синтез сред улучшил Qwen3 на 11,9% в задачах агентов

Исследователи представили EnvCraft — фреймворк для автоматического создания исполняемых сред, который решил проблему нехватки данных для обучения автономных AI-агентов.

Баннер новости 7169

Проблема: тупик в обучении автономных агентов

Параллельно с развитием LLM, индустрия столкнулась с критическим дефицитом качественных интерактивных сред для обучения агентов (Agentic RL). Существующие синтетические среды ограничиваются лишь вызовом инструментов (tool-calling), что недостаточно для сложных сценариев, где агент должен работать в состоятельных рабочих пространствах (stateful workspaces) и выполнять задачи с длинным горизонтом планирования. Это создает «бутылочное горлышко» для масштабирования автономных систем.

Решение: EnvCraft и два движка синтеза

Команда авторов (Yirong Zeng, Shen You и др.) представила EnvCraft — автоматизированный фреймворк, который генерирует как сами среды, так и данные для их обучения. Архитектура включает два ключевых компонента:

  • Environment Synthesis Engine: создает изолированные песочницы (sandbox-isolated workspaces), имитирующие реальные условия.
  • Topology-aware Data Generation Engine: генерирует связные траектории задач, учитывая топологию среды, чтобы обеспечить логическую целостность действий агента.

Масштаб данных и результаты

Исследователи синтезировали 139 уникальных интерактивных сред, содержащих около 20 000 сложных задач. Тестирование проводилось на моделях Qwen3 и Qwen3.5 (размеры 8B и 32B). Метод показал значительное улучшение метрик по сравнению с базовыми линиями, особенно в задачах, требующих длительного взаимодействия.

Метрика / Модель Результат улучшения Примечание
Claw-style benchmarks (Qwen3/3.5) +11.9% Рост точности в сложных задачах с длинным горизонтом
General tool-use benchmarks +8.0% Улучшение в общих задачах использования инструментов
Стоимость инференса Снижение Одновременное уменьшение количества токенов на запрос

Почему это важно

Результаты подтверждают, что синтезированные исполняемые среды предоставляют robust (устойчивые) и обобщаемые сигналы обучения. Это позволяет обучать агентов не просто «отвечать на вопросы», а эффективно действовать в сложных, многошаговых сценариях, приближая их к реальным требованиям индустрии. Снижение стоимости инференса делает такой подход экономически выгодным для массового внедрения.

Источник: arXiv cs.AI ↗