Проблема стандартной on-policy дистилляции (OPD)
On-policy distillation (OPD) стала эффективным фреймворком для постобучения языковых моделей, где траектории, сгенерированные студентом, сопоставляются с плотным токеном-уровневым надзором от учителя. Однако стандартный подход неявно предполагает, что награды, полученные от учителя, являются адекватной прокси-мерой для прогресса рассуждений. На практике это не всегда так: шаги рассуждений, демонстрирующие явное продвижение вперед, могут получать низкие награды дистилляции просто из-за отклонения от выводов учителя, что приводит к конфликту между «правильным» логическим путем и «предпочтительным» путем учителя.
Решение: R2-OPD
Авторы (Чен Ян, Хайюань Ван, Рэнронг Шюн, Ицзе Чэнь, Дэнни Х.К. Цанг) предлагают метод Reasoning-Progress-Aware Reward Filtering for On-Policy Distillation (R2-OPD). Суть метода заключается в построении двух ранжирований внутри одной траектории:
- Ранжирование на основе наград, полученных от учителя (teacher-derived rewards).
- Ранжирование на основе независимо оцененной награды прогресса рассуждений (progress reward).
Когда эти два ранжирования расходятся, награды дистилляции выборочно подавляются. Это позволяет сохранить эффективное руководство учителя, но устранить надзор, который противоречит реальному прогрессу рассуждений.
Ключевые метрики и результаты
Метод R2-OPD демонстрирует последовательное улучшение по сравнению со стандартной OPD, особенно в задачах, требующих сложных логических рассуждений. Ниже приведена сравнительная характеристика подхода:
| Характеристика | Стандартная OPD | R2-OPD (предложенный метод) |
|---|---|---|
| Источник наград | Только от учителя (teacher-derived) | Фильтрация: учитель + прогресс рассуждений |
| Обработка конфликтов | Игнорируется (все награды равны) | Подавление при расхождении ранжирований |
| Фокус оптимизации | Имитация выводов учителя | Прогресс рассуждений + полезное руководство |
| Результат | Снижение качества при сложных логических шагах | Последовательное улучшение логических способностей |
Почему это важно
Работа, опубликованная 19 августа 2026 года в arXiv (cs.AI), решает фундаментальную проблему «слепой имитации». Показывая, что можно отделить полезный логический прогресс от артефактов обучения учителя, R2-OPD открывает путь к более надежному сжатию больших моделей (LLM) без потери их способности к глубокому анализу и цепочкам рассуждений (Chain-of-Thought).
Источник: arXiv cs.AI ↗
