Прорыв в обучении малых моделей через поиск
Команда исследователей во главе с Gaurisankar Jayadas продемонстрировала, что метод Reinforcement Learning with Verifiable Rewards (RLVR), ранее успешный только на больших моделях, эффективен и для «малышей» с параметрами менее 1 миллиарда. В центре эксперимента — модель Qwen3.5-0.8B, обученная с использованием алгоритма Group Relative Policy Optimization (GRPO) и инструмента поиска по Wikipedia.
Ключевое отличие от предыдущих подходов: обучение проводилось без этапа дистилляции от более крупной модели-учителя. Это открывает путь к самостоятельному обучению компактных агентов в условиях открытого домена.
Результаты: от 9.2% до 35.2%
Модель тестировалась на датасете MuSiQue (сложные вопросы, требующие рассуждений) и валидировалась на наборе из семи бенчмарков. Исследователи варьировали три типа наград (reward shapes) на трех разных случайных семенах. Результаты превзошли базовый уровень:
| Метрика / Параметр | Значение | Примечание |
|---|---|---|
| Базовый уровень (untrained) | 0.092 | Exact Match без обучения |
| Лучший результат (Best Run) | 0.352 | Рост в 3.8 раза |
| Датасет обучения | MuSiQue | Интерлированный поиск по Wikipedia |
| Алгоритм оптимизации | GRPO | Group Relative Policy Optimization |
Почему стандартная награда не сработала
Самым интригующим выводом стало то, что «стандартная» для RLVR награда — Search-R1-faithful (ориентированная только на точное совпадение ответа) — показала худшие результаты. Даже на метрике Exact Match, которую она напрямую оптимизирует, эта форма награды проигрывала другим вариантам.
Авторы приходят к выводу, что разреженная награда на точное совпадение, эффективная в математике и коде, является неправильным стартом для малых моделей в задачах поиска. Архитектура награды для RLVR на малых моделях требует отдельного исследования, а не простого масштабирования рецептов для больших LLM.
Значение для индустрии
Работа доказывает жизнеспособность архитектуры «reason-over-search» для компактных моделей. Это критически важно для развертывания AI-агентов на edge-устройствах и в условиях ограниченных вычислительных ресурсов, где использование тяжелых моделей-учителей для дистилляции невозможно или нецелесообразно.
Источник: arXiv cs.AI ↗
