Исследования30 июня 2026 г., 18:18 МСК🤖 Auto

SEAD: Как энтропия ускорила обучение OLMo-3 на 4.8%

Исследователи представили SEAD — метод он-полси дистилляции, который использует энтропию для оценки компетенции модели, пропуская 50% токенов и повышая точность на математических задачах.

Баннер новости 2582

Проблема «шума» в он-полси дистилляции

Он-полси дистилляция (On-Policy Distillation, OPD) имеет критический недостаток, отсутствующий в оффлайн-обучении: качество обучения учителя напрямую зависит от текущей компетенции ученика. Если ученик генерирует некорректные цепочки (incoherent rollouts), градиенты становятся зашумленными. Если же ученик уже знает ответ, градиенты становятся избыточными. Это приводит к трем видам расточительности: на уровне токенов, фаз обучения и промптов. Существующие методы применяли унифицированное обучение, игнорируя эти различия.

Решение SEAD: Энтропия как индикатор

Авторы (Chia-Hsuan Lee, Zelei Cheng, Yu Wang и др.) предложили метод SEAD, использующий энтропию как универсальный зонд для оценки компетенции. Метод работает на трех уровнях:

  • Фильтрация токенов: Совместная энтропия учителя и ученика разделяет токены на зоны. Для «сложных» токенов применяются специфические расхождения, а для «легких» — обнуляются градиенты. Это позволяет пропускать около 50% токенов, экономя вычислительные ресурсы.
  • Адаптивное расписание: Используется косинусное расписание, которое аннеалирует (плавное снижение) от прямого KL-расхождения к обратному по мере роста компетенции модели.
  • Куррикумное обучение: Вводится «компетенция-гейтированная» программа, где промпты подаются от простых к сложным. Это необходимо для обеспечения монотонного улучшения, требуемого для аннеалирования.

Результаты на OLMo-3

Эксперименты проводились на моделях OLMo-3 (от 7B до 32B параметров). SEAD демонстрирует супер-аддитивный эффект: компоненты метода работают лучше в связке, чем по отдельности. Метод обеспечивает прирост средней точности на 4.8% по сравнению с базовой OPD на шести математических бенчмарках.

Метрика / Параметр Значение / Описание
Базовая модель OLMo-3 (7B, 32B)
Прирост точности +4.8% (среднее по 6 математическим бенчмаркам)
Эффективность токенов ~50% токенов пропускается (нулевые градиенты)
Ключевой механизм Энтропия учителя и ученика
Тип расхождения Аннеалирование от Forward KL к Reverse KL

Почему это важно

SEAD решает фундаментальную проблему эффективности обучения LLM. Отсекая «шум» и «избыточность» на уровне токенов, метод не только повышает точность, но и снижает вычислительную нагрузку. Синергия между фильтрацией токенов и куррикумным обучением показывает, что адаптация к текущему уровню знаний модели — ключ к следующему скачку в эффективности дистилляции.

Источник: arXiv cs.CL ↗