Исследования8 сентября 2026 г., 03:17 МСК🤖 Auto

MBP: Как паузы в тексте улучшают логику LLM без потери знаний

Исследование arXiv:2609.04489 раскрывает механизм Masked Boundary Pause (MBP), который повышает математические и кодовые навыки моделей Qwen и Llama (1B-8B) на 6 и 2.5 балла соответственно, сохраняя общие языковые способности.

Баннер новости 6980

Проблема: «Загрязнение» знаний при дообучении

Традиционно считается, что специальные токены паузы (pause tokens) улучшают рассуждения LLM за счет вычислительной выразительности. Однако исследователи из Южной Кореи (Kim, Lee, Seo и др.) обнаружили, что процесс дообучения с их использованием часто приводит к потере ранее усвоенных общих языковых навыков. Это классическая дилемма: адаптация под сложную задачу (математику/код) «стирает» базовое понимание языка.

Решение: Masked Boundary Pause (MBP)

Авторы предлагают метод Masked Boundary Pause (MBP). Суть заключается в двух ключевых изменениях:

  • Позиционирование: Токены паузы вставляются строго на границах шагов рассуждения (reasoning-step boundaries).
  • Маскирование: Потеря (loss) на этих токенах маскируется во время обучения. Это предотвращает их «переобучение» под специфическую задачу и сохраняет их как нейтральные маркеры времени.

Механика: Retention vs. Adaptation

Исследование выявило два важных феномена при использовании MBP:

  1. Retention (H1): На синтетических задачах непрерывного обучения маскированные паузы перезаписывают ранее изученное распределение данных примерно в 4 раза реже, чем обычные токены. Это позволяет модели удерживать режим (mode) общих знаний.
  2. Non-myopic compression (H2): Токен, следующий за паузой, начинает кодировать значительно больше информации о будущих шагах рассуждения, действуя как «мост» между этапами логики.

Результаты на Qwen и Llama

Метод MBP протестирован на моделях семейства Qwen и Llama в диапазоне от 1B до 8B параметров. Стратегия показала стабильное улучшение без регрессии общих способностей. Сравнение эффективности представлено ниже:

Метрика / Задача Результат улучшения (MBP) Примечание
Математическое мышление +6.0 баллов Значительный прирост на сложных задачах
Генерация кода +2.5 балла Улучшение синтаксической и логической точности
Общее языковое понимание Сохранено (No Regression) Ключевое преимущество перед стандартным RLHF/GRPO

Значение для индустрии

Работа переосмысливает токены паузы не просто как инструмент для увеличения времени генерации на этапе инференса, а как мощный механизм управления динамикой обучения. Авторы также демонстрируют, что MBP эффективно расширяет gains при использовании алгоритма GRPO (Group Relative Policy Optimization). Это открывает путь к созданию более «умных» и узкоспециализированных моделей, которые не забывают, как просто общаться, после обучения решению сложных логических задач.

Источник: arXiv cs.CL ↗