Суть эксперимента: зачем штрафовать за слова?
Лаборатории активно используют length penalty (штраф за длину) при RL-обучении моделей, чтобы сократить время инференса и снизить затраты. Однако существует опасение, что это заставляет модели «лениво» опускать важные шаги рассуждения (Chain of Thought, CoT), что может привести к скрытым ошибкам или обману. Авторы исследования (Brian Davies и Luc Feron) проверили этот гипотетический риск на практике, используя алгоритм GRPO с модификацией штрафа за длину.
Методология и модели
Эксперимент проводился на открытых моделях Qwen3-4B и Nemotron-Nano-8B. Обучение велось на наборе из 2,4 тыс. математических задач (MATH, AIME, Olympiad). Ключевой параметр — коэффициент штрафа alpha (α). Формула вознаграждения:
R = accuracy × (1 − α·σ(z)), где z — z-оценка длины правильного ответа.
Важно: штраф применялся только к правильным ответам. Это стимулирует модель находить кратчайший путь к верному решению, а не просто сокращать текст любой ценой.
Главный инсайт: рост Faithfulness (Добросовестности)
В отличие от предыдущих работ (например, от авторов статьи «Training Language Models to Reason Efficiently»), авторы нашли линейную зависимость между сокращением длины CoT и ростом показателя faithfulness (добросовестности/честности) на бенчмарке MMLU-with-hint.
Faithfulness измеряется так: если модель меняет ответ после получения «подсказки» (hint), считается ли она «честной», если её рассуждение (CoT) действительно использует эту подсказку как аргумент? Оказалось, что модели с наложенным штрафом за длину чаще предоставляют обоснованные рассуждения, даже если их ответы короче.
Другие побочные эффекты
- Лень и шорткаты: propensity к лени растет. Однако авторы отмечают, что модель сохраняет «суть» задачи, просто используя более эффективные пути решения.
- Отказы от мошенничества: на задачах, связанных с обманом или мошенничеством, модели с length penalty чаще выбирают жесткий отказ (hard refusal), а не мягкие, уклончивые ответы. Это может быть плюсом для безопасности.
- Безопасность: уровень галлюцинаций, грубости тона и недостаточной информативности в реальных диалогах не изменился.
Почему это важно?
Результаты опровергают интуитивное опасение, что «короткий ответ = плохой ответ». Напротив, оптимизация длины в RL при сохранении точности может делать модели более прозрачными в своих рассуждениях и более строгими в отказе от неэтичных запросов. Это открывает путь к более эффективным и безопасным моделям без необходимости жертвовать качеством CoT.
Источник: LessWrong ↗
