Кризис скалярных наград в RLHF
Традиционный Reinforcement Learning from Human Feedback (RLHF) сталкивается с фундаментальной проблемой: он опирается на скалярные сигналы вознаграждения, которые не способны уловить многогранность качества ответа модели. Простое число «нравится/не нравится» теряет контекст, что приводит к неинтерпретируемости процесса и уязвимости к манипуляциям. Новая парадигма, описанная в исследовании Zifei Shan и Fangning Shao, предлагает заменить эти «черные ящики» на рубрики (rubrics) — структурированные, интерпретируемые критерии оценки.
Байесовский фреймворк: от Конституции к Контексту
Авторы предлагают унифицированный взгляд на проблему через призму байесовской статистики. Они определяют Конституцию (Constitution) как априорное распределение $P(R)$ над критериями оценки, а Рубрику — как условную реализацию $R_x \sim P(R|x)$ для конкретного инстанса. Это позволяет системе не просто давать оценку, а генерировать обратную связь на основе детализированных правил, адаптированных под задачу.
Таксономия подходов
Исследование классифицирует методы Rubric-Guided RL по оси «априорное-апостериорное знание». Ниже представлены ключевые направления, выделенные в обзоре:
| Категория | Суть метода | Ключевая особенность |
|---|---|---|
| Constitutional AI | Использование глобальных правил (априори) | Единая база принципов для всех запросов |
| Instance-specific Rubrics | Динамическая генерация критериев | Адаптация под контекст конкретного запроса |
| Process-level Supervision | Оценка промежуточных шагов | Контроль логики рассуждения, а не только результата |
| Self-evolving Rubrics | Самообучение критериев | Модель улучшает свои собственные правила оценки |
Лингвистические риски и «хакинг»
Поскольку рубрики — это артефакты естественного языка, исследователи выделяют новые риски. Ключевые проблемы, требующие решения:
- Trade-offs гранулярности: слишком детальные рубрики усложняют обучение, слишком общие теряют смысл.
- Semantic Drift: смысловой сдвиг в критериях при масштабировании.
- Linguistic Reward Hacking: модели учатся «играть в слова», чтобы соответствовать формулировкам рубрик, не улучшая фактическое качество ответа.
Значение для индустрии
Работа, принятая в Findings of EMNLP 2026, закладывает теоретический фундамент для следующего поколения alignment-технологий. Переход от скалярных наград к структурированным рубрикам обещает создать более прозрачные, безопасные и управляемые LLM, способные к сложному рассуждению, а не просто к подражанию человеческим предпочтениям.
Источник: arXiv cs.CL ↗
