Исследования25 сентября 2026 г., 12:18 МСК🤖 Auto

RLVR для малых моделей: Qwen3.5-0.8B научился искать в Wikipedia

Исследователи применили Reinforcement Learning with Verifiable Rewards к модели Qwen3.5-0.8B без дистилляции, получив рост точности в 3.8 раза. Главный вывод: стандартные награды из математики не работают для поиска.

Баннер новости 8254

Прорыв в обучении малых моделей через поиск

Команда исследователей во главе с Gaurisankar Jayadas продемонстрировала, что метод Reinforcement Learning with Verifiable Rewards (RLVR), ранее успешный только на больших моделях, эффективен и для «малышей» с параметрами менее 1 миллиарда. В центре эксперимента — модель Qwen3.5-0.8B, обученная с использованием алгоритма Group Relative Policy Optimization (GRPO) и инструмента поиска по Wikipedia.

Ключевое отличие от предыдущих подходов: обучение проводилось без этапа дистилляции от более крупной модели-учителя. Это открывает путь к самостоятельному обучению компактных агентов в условиях открытого домена.

Результаты: от 9.2% до 35.2%

Модель тестировалась на датасете MuSiQue (сложные вопросы, требующие рассуждений) и валидировалась на наборе из семи бенчмарков. Исследователи варьировали три типа наград (reward shapes) на трех разных случайных семенах. Результаты превзошли базовый уровень:

Метрика / Параметр Значение Примечание
Базовый уровень (untrained) 0.092 Exact Match без обучения
Лучший результат (Best Run) 0.352 Рост в 3.8 раза
Датасет обучения MuSiQue Интерлированный поиск по Wikipedia
Алгоритм оптимизации GRPO Group Relative Policy Optimization

Почему стандартная награда не сработала

Самым интригующим выводом стало то, что «стандартная» для RLVR награда — Search-R1-faithful (ориентированная только на точное совпадение ответа) — показала худшие результаты. Даже на метрике Exact Match, которую она напрямую оптимизирует, эта форма награды проигрывала другим вариантам.

Авторы приходят к выводу, что разреженная награда на точное совпадение, эффективная в математике и коде, является неправильным стартом для малых моделей в задачах поиска. Архитектура награды для RLVR на малых моделях требует отдельного исследования, а не простого масштабирования рецептов для больших LLM.

Значение для индустрии

Работа доказывает жизнеспособность архитектуры «reason-over-search» для компактных моделей. Это критически важно для развертывания AI-агентов на edge-устройствах и в условиях ограниченных вычислительных ресурсов, где использование тяжелых моделей-учителей для дистилляции невозможно или нецелесообразно.

Источник: arXiv cs.AI ↗