Исследования31 августа 2026 г., 10:17 МСК🤖 Auto

RLHF 2.0: Как рубрики заменяют скалярные награды в обучении LLM

Исследователи представили первую систематизацию Rubric-Guided RL, объясняя, почему структурированные критерии оценки превосходят традиционный RLHF в интерпретируемости и надежности.

Баннер новости 6399

Кризис скалярных наград в RLHF

Традиционный Reinforcement Learning from Human Feedback (RLHF) сталкивается с фундаментальной проблемой: он опирается на скалярные сигналы вознаграждения, которые не способны уловить многогранность качества ответа модели. Простое число «нравится/не нравится» теряет контекст, что приводит к неинтерпретируемости процесса и уязвимости к манипуляциям. Новая парадигма, описанная в исследовании Zifei Shan и Fangning Shao, предлагает заменить эти «черные ящики» на рубрики (rubrics) — структурированные, интерпретируемые критерии оценки.

Байесовский фреймворк: от Конституции к Контексту

Авторы предлагают унифицированный взгляд на проблему через призму байесовской статистики. Они определяют Конституцию (Constitution) как априорное распределение $P(R)$ над критериями оценки, а Рубрику — как условную реализацию $R_x \sim P(R|x)$ для конкретного инстанса. Это позволяет системе не просто давать оценку, а генерировать обратную связь на основе детализированных правил, адаптированных под задачу.

Таксономия подходов

Исследование классифицирует методы Rubric-Guided RL по оси «априорное-апостериорное знание». Ниже представлены ключевые направления, выделенные в обзоре:

Категория Суть метода Ключевая особенность
Constitutional AI Использование глобальных правил (априори) Единая база принципов для всех запросов
Instance-specific Rubrics Динамическая генерация критериев Адаптация под контекст конкретного запроса
Process-level Supervision Оценка промежуточных шагов Контроль логики рассуждения, а не только результата
Self-evolving Rubrics Самообучение критериев Модель улучшает свои собственные правила оценки

Лингвистические риски и «хакинг»

Поскольку рубрики — это артефакты естественного языка, исследователи выделяют новые риски. Ключевые проблемы, требующие решения:

  • Trade-offs гранулярности: слишком детальные рубрики усложняют обучение, слишком общие теряют смысл.
  • Semantic Drift: смысловой сдвиг в критериях при масштабировании.
  • Linguistic Reward Hacking: модели учатся «играть в слова», чтобы соответствовать формулировкам рубрик, не улучшая фактическое качество ответа.

Значение для индустрии

Работа, принятая в Findings of EMNLP 2026, закладывает теоретический фундамент для следующего поколения alignment-технологий. Переход от скалярных наград к структурированным рубрикам обещает создать более прозрачные, безопасные и управляемые LLM, способные к сложному рассуждению, а не просто к подражанию человеческим предпочтениям.

Источник: arXiv cs.CL ↗