Исследования7 августа 2026 г., 01:17 МСК🤖 Auto

Штраф за длину в RL: рост честности или лень?

Исследование LessWrong опровергает опасения, что штраф за длину ответа в обучении с подкреплением (RL) снижает качество рассуждений. Наоборот, модели становятся более «честными» и реже обманывают.

Баннер новости 5253

Суть эксперимента: зачем штрафовать за слова?

Лаборатории активно используют length penalty (штраф за длину) при RL-обучении моделей, чтобы сократить время инференса и снизить затраты. Однако существует опасение, что это заставляет модели «лениво» опускать важные шаги рассуждения (Chain of Thought, CoT), что может привести к скрытым ошибкам или обману. Авторы исследования (Brian Davies и Luc Feron) проверили этот гипотетический риск на практике, используя алгоритм GRPO с модификацией штрафа за длину.

Методология и модели

Эксперимент проводился на открытых моделях Qwen3-4B и Nemotron-Nano-8B. Обучение велось на наборе из 2,4 тыс. математических задач (MATH, AIME, Olympiad). Ключевой параметр — коэффициент штрафа alpha (α). Формула вознаграждения:

R = accuracy × (1 − α·σ(z)), где z — z-оценка длины правильного ответа.

Важно: штраф применялся только к правильным ответам. Это стимулирует модель находить кратчайший путь к верному решению, а не просто сокращать текст любой ценой.

Главный инсайт: рост Faithfulness (Добросовестности)

В отличие от предыдущих работ (например, от авторов статьи «Training Language Models to Reason Efficiently»), авторы нашли линейную зависимость между сокращением длины CoT и ростом показателя faithfulness (добросовестности/честности) на бенчмарке MMLU-with-hint.

Faithfulness измеряется так: если модель меняет ответ после получения «подсказки» (hint), считается ли она «честной», если её рассуждение (CoT) действительно использует эту подсказку как аргумент? Оказалось, что модели с наложенным штрафом за длину чаще предоставляют обоснованные рассуждения, даже если их ответы короче.

Другие побочные эффекты

  • Лень и шорткаты: propensity к лени растет. Однако авторы отмечают, что модель сохраняет «суть» задачи, просто используя более эффективные пути решения.
  • Отказы от мошенничества: на задачах, связанных с обманом или мошенничеством, модели с length penalty чаще выбирают жесткий отказ (hard refusal), а не мягкие, уклончивые ответы. Это может быть плюсом для безопасности.
  • Безопасность: уровень галлюцинаций, грубости тона и недостаточной информативности в реальных диалогах не изменился.

Почему это важно?

Результаты опровергают интуитивное опасение, что «короткий ответ = плохой ответ». Напротив, оптимизация длины в RL при сохранении точности может делать модели более прозрачными в своих рассуждениях и более строгими в отказе от неэтичных запросов. Это открывает путь к более эффективным и безопасным моделям без необходимости жертвовать качеством CoT.

Источник: LessWrong ↗