Исследования1 октября 2026 г., 07:21 МСК🤖 Auto

AREX-2: Qwen3.8-27B учится на ошибках и бьет рекорды в самообучении

Исследователи представили AREX-2 — агента на базе Qwen3.8-27B, который итеративно улучшает свои решения через рефлексию. Модель демонстрирует прорывные результаты на сложных бенчмарках, доказывая эффективность долгосрочного обучения на собственных ош

Баннер новости 8664

Суть прорыва: от разовых ответов к итеративному совершенству

Команда исследователей во главе с Хундзином Цянем (Hongjin Qian) представила AREX-2 — архитектуру агента на базе LLM, способную к самоулучшению (self-improving) в реальном времени. В отличие от стандартных моделей, которые выдают один ответ, AREX-2 обладает двумя ключевыми навыками: рефлексией (анализ текущего решения для поиска улучшений) и долгосрочным выполнением (способность поддерживать итерации на протяжении многих раундов без потери контекста).

Ключевая гипотеза авторов: эти способности универсальны (domain-agnostic). Поэтому для обучения использовались не специфичные для домена данные, а синтетические траектории улучшения решений в задачах машинного обучения и алгоритмического программирования, где есть четкий верифицируемый фидбек.

Архитектура и данные

Базовой моделью для AREX-2 стала Qwen3.8-27B. Обучение проводилось на специально синтезированных данных, имитирующих процесс «попробовал — ошибся — проанализировал — улучшил». Это позволяет агенту учиться на сложных задачах, требующих длительного планирования, а не просто на статичных вопросах.

Результаты: цифры и бенчмарки

AREX-2 показывает выдающиеся результаты, особенно в задачах, требующих глубокого поиска и рассуждений. Важно отметить, что производительность модели продолжает расти по мере увеличения бюджета раундов (итераций).

Бенчмарк Результат AREX-2 Примечание
MLE-bench Lite 81.8 Задачи машинного обучения
Frontier-CS 70.7 Сложные задачи компьютерных наук
BrowseComp 84.0 Глубокий веб-поиск (Deep Research)
HLE 52.6 High-Level Entailment
GAIA 92.2 Общие способности агентов
DeepSearchQA 93.8 Глубокий поиск ответов

Почему это важно для индустрии

Результаты AREX-2 подтверждают, что данные долгосрочной рефлексии — это эффективный путь к созданию автономных агентов. Способность модели не просто «угадывать» ответ, а систематически улучшать его через несколько циклов анализа, открывает путь к решению задач, которые ранее были недоступны для LLM из-за ограничений контекста или сложности логики. Код и модели будут опубликованы в открытом доступе, что ускорит внедрение подобных подходов в разработку AI-ассистентов.

Источник: arXiv cs.AI ↗