Проблема «шума» в он-полси дистилляции
Он-полси дистилляция (On-Policy Distillation, OPD) имеет критический недостаток, отсутствующий в оффлайн-обучении: качество обучения учителя напрямую зависит от текущей компетенции ученика. Если ученик генерирует некорректные цепочки (incoherent rollouts), градиенты становятся зашумленными. Если же ученик уже знает ответ, градиенты становятся избыточными. Это приводит к трем видам расточительности: на уровне токенов, фаз обучения и промптов. Существующие методы применяли унифицированное обучение, игнорируя эти различия.
Решение SEAD: Энтропия как индикатор
Авторы (Chia-Hsuan Lee, Zelei Cheng, Yu Wang и др.) предложили метод SEAD, использующий энтропию как универсальный зонд для оценки компетенции. Метод работает на трех уровнях:
- Фильтрация токенов: Совместная энтропия учителя и ученика разделяет токены на зоны. Для «сложных» токенов применяются специфические расхождения, а для «легких» — обнуляются градиенты. Это позволяет пропускать около 50% токенов, экономя вычислительные ресурсы.
- Адаптивное расписание: Используется косинусное расписание, которое аннеалирует (плавное снижение) от прямого KL-расхождения к обратному по мере роста компетенции модели.
- Куррикумное обучение: Вводится «компетенция-гейтированная» программа, где промпты подаются от простых к сложным. Это необходимо для обеспечения монотонного улучшения, требуемого для аннеалирования.
Результаты на OLMo-3
Эксперименты проводились на моделях OLMo-3 (от 7B до 32B параметров). SEAD демонстрирует супер-аддитивный эффект: компоненты метода работают лучше в связке, чем по отдельности. Метод обеспечивает прирост средней точности на 4.8% по сравнению с базовой OPD на шести математических бенчмарках.
| Метрика / Параметр | Значение / Описание |
|---|---|
| Базовая модель | OLMo-3 (7B, 32B) |
| Прирост точности | +4.8% (среднее по 6 математическим бенчмаркам) |
| Эффективность токенов | ~50% токенов пропускается (нулевые градиенты) |
| Ключевой механизм | Энтропия учителя и ученика |
| Тип расхождения | Аннеалирование от Forward KL к Reverse KL |
Почему это важно
SEAD решает фундаментальную проблему эффективности обучения LLM. Отсекая «шум» и «избыточность» на уровне токенов, метод не только повышает точность, но и снижает вычислительную нагрузку. Синергия между фильтрацией токенов и куррикумным обучением показывает, что адаптация к текущему уровню знаний модели — ключ к следующему скачку в эффективности дистилляции.
Источник: arXiv cs.CL ↗
