Проблема: «Загрязнение» знаний при дообучении
Традиционно считается, что специальные токены паузы (pause tokens) улучшают рассуждения LLM за счет вычислительной выразительности. Однако исследователи из Южной Кореи (Kim, Lee, Seo и др.) обнаружили, что процесс дообучения с их использованием часто приводит к потере ранее усвоенных общих языковых навыков. Это классическая дилемма: адаптация под сложную задачу (математику/код) «стирает» базовое понимание языка.
Решение: Masked Boundary Pause (MBP)
Авторы предлагают метод Masked Boundary Pause (MBP). Суть заключается в двух ключевых изменениях:
- Позиционирование: Токены паузы вставляются строго на границах шагов рассуждения (reasoning-step boundaries).
- Маскирование: Потеря (loss) на этих токенах маскируется во время обучения. Это предотвращает их «переобучение» под специфическую задачу и сохраняет их как нейтральные маркеры времени.
Механика: Retention vs. Adaptation
Исследование выявило два важных феномена при использовании MBP:
- Retention (H1): На синтетических задачах непрерывного обучения маскированные паузы перезаписывают ранее изученное распределение данных примерно в 4 раза реже, чем обычные токены. Это позволяет модели удерживать режим (mode) общих знаний.
- Non-myopic compression (H2): Токен, следующий за паузой, начинает кодировать значительно больше информации о будущих шагах рассуждения, действуя как «мост» между этапами логики.
Результаты на Qwen и Llama
Метод MBP протестирован на моделях семейства Qwen и Llama в диапазоне от 1B до 8B параметров. Стратегия показала стабильное улучшение без регрессии общих способностей. Сравнение эффективности представлено ниже:
| Метрика / Задача | Результат улучшения (MBP) | Примечание |
|---|---|---|
| Математическое мышление | +6.0 баллов | Значительный прирост на сложных задачах |
| Генерация кода | +2.5 балла | Улучшение синтаксической и логической точности |
| Общее языковое понимание | Сохранено (No Regression) | Ключевое преимущество перед стандартным RLHF/GRPO |
Значение для индустрии
Работа переосмысливает токены паузы не просто как инструмент для увеличения времени генерации на этапе инференса, а как мощный механизм управления динамикой обучения. Авторы также демонстрируют, что MBP эффективно расширяет gains при использовании алгоритма GRPO (Group Relative Policy Optimization). Это открывает путь к созданию более «умных» и узкоспециализированных моделей, которые не забывают, как просто общаться, после обучения решению сложных логических задач.
Источник: arXiv cs.CL ↗
