Инструменты3 августа 2026 г., 19:00 МСК🤖 Auto

Microsoft Orchard: как 3B-модель обходит гигантов в задачах агентов

Microsoft Research представила Orchard — фреймворк для обучения AI-агентов. Модель на 3 млрд параметров достигла 73% на SWE-bench, конкурируя с системами в 10 раз больше.

Баннер новости 4969

Проблема закрытых систем и решение Microsoft

Развитие автономных AI-агентов уперлось в инфраструктурный тупик: создание state-of-the-art систем требует проприетарных песочниц, закрытых датасетов и пайплайнов, недоступных широкому сообществу. Microsoft Research решает эту проблему, выпуская Orchard — открытый фреймворк для масштабируемого обучения агентов. В основе лежит Orchard Env, легковесный сервис на базе Kubernetes, который позволяет изолированно запускать тысячи компонентов для сбора данных, reinforcement learning (RL) и оценки.

Ключевое отличие Orchard — возможность обучения агентов непосредственно в тех же «хarness» (оболочках), в которых они будут развернуты. Фреймворк поддерживает Codex, OpenClaw и ZeroClaw, записывая вызовы моделей в реальном времени, что устраняет разрыв между симуляцией и продакшеном.

Orchard-SWE: Прорыв в программировании с малыми моделями

Для задач software engineering (SWE) Microsoft разработала рецепт Orchard-SWE. Модель использует всего ~3 млрд активных параметров, но демонстрирует результаты, сопоставимые с системами, имеющими более 30 млрд параметров. Обучение прошло через несколько этапов:

  • Supervised Fine-Tuning (SFT): Использовано 107 000 взаимодействий, дистиллированных из моделей MiniMax-M2.5 и Qwen3.5-397B. Применена техника credit-assignment, позволяющая учиться на частичных успехах, а не только на финальных патчах.
  • Reinforcement Learning (RL): Применена Balanced Adaptive Rollout для работы с разреженными сигналами успеха. Добавлены «плотные награды» (dense rewards): он-поллайн дистилляция от сильной модели-учителя и процессная модель вознаграждения, оценивающая логику решения (написание тестов, проверку фиксов).
  • Value Model Reranking: Отдельная 4-миллиардная модель обучалась на прошлых rollout-ах для ранжирования кандидатов и выбора лучшего решения.

Результаты и бенчмарки

Итоговые метрики Orchard-SWE на бенчмарке SWE-bench Verified впечатляют. Модель не просто достигла нового SOTA для open-source решений своего размера, но и приблизилась к флагманским проприетарным системам.

Метрика / Модель Результат (SWE-bench Verified) Примечание
Базовый уровень (Baseline) 61.4% Исходная точка обучения
Orchard-SWE + Balanced Adaptive Rollout 69.1% После RL-шага
Orchard-SWE + Dense Rewards 69.7% Новый SOTA для ~3B параметров
Orchard-SWE + Value Model Reranking 73.0% Конкурирует с системами >30B параметров

Orchard-GUI: Веб-агенты с минимальными данными

Параллельно представлен Orchard-GUI — агент для навигации в браузере на базе 4-миллиардной vision-language модели. Несмотря на ограниченное количество обучающих данных (400 дистиллированных демонстраций и 2 200 открытых задач), модель показала высокую эффективность:

  • WebVoyager: 74.1%
  • Online-Mind2Web: 67.0%
  • DeepShop: 64.0%
  • Средний результат: 68.4%

Эти показатели делают Orchard-GUI одним из сильнейших open-source GUI-агентов, сравнимым с решениями от OpenAI и Google. Microsoft также публикует обучающие данные и методы оценки, чтобы стимулировать развитие открытой экосистемы агентов.

Источник: Microsoft Research ↗