Проблема «артефактов рубрики»
Параллельно с развитием генеративных моделей, индустрия все чаще полагается на подход LLM-as-a-Judge для автоматической оценки качества текста. Стандартная методология предполагает, что большая языковая модель анализирует ответ кандидата в контексте заданных критериев (рубрики) и выносит вердикт. Однако новое исследование авторов Anshul Bagaria, Sowmya S. Sundaram, Gokul S. Krishnan и Balaraman Ravindran вскрывает фундаментальный дефект этого процесса: оценщики часто «читают» рубрику, а не оценивают контент.
Эксперимент: классификаторы без доступа к ответам
Ученые провели серию тестов, чтобы проверить, насколько сильно формулировка критериев влияет на итоговый балл. Ключевой эксперимент заключался в обучении классификаторов исключительно на тексте рубрики, без предоставления им самого оцениваемого ответа (candidate response). Результаты оказались шокирующими: такие модели достигали нетривиальной предсказательной точности относительно решений LLM-судей. Это доказывает, что в формулировках рубрик зашиты скрытые сигналы, позволяющие предсказать оценку еще до анализа ответа.
Контрфактуальные возмущения
Для проверки устойчивости оценок исследователи применили метод контрфактуальных возмущений (counterfactual perturbations). Они намеренно инвертировали как кандидатские ответы, так и критерии рубрики. Выяснилось, что LLM-судьи часто не способны надежно обновить свои решения при изменении условий. Модель может выдать высокий балл за плохой ответ, если рубрика сформулирована определенным образом, и проигнорировать качественные изменения в тексте.
Сводка результатов
| Метрика / Аспект | Наблюдение | Значение |
|---|---|---|
| Предсказуемость оценок | Высокая корреляция с текстом рубрики | Оценка зависит от формулировки, а не только от ответа |
| Устойчивость к изменениям | Низкая при контрфактуальных возмущениях | Судьи игнорируют существенные изменения в ответе или критериях |
| Валидность assumptions | Гипотеза о «рассуждении» опровергнута | LLM не всегда анализирует ответ, а имитирует ожидание |
Почему это важно для индустрии
Результаты публикации, принятой к изданию в EMNLP 2026, сигнализируют о необходимости пересмотра методологий автоматической оценки. Если LLM-судьи подвержены влиянию артефактов рубрики, то бенчмарки, построенные на их основе, могут давать ложноположительные результаты, маскируя регрессии в качестве моделей. Исследователи призывают к более строгой методологической работе, чтобы отделить реальное понимание текста от поверхностного совпадения с паттернами в промптах.
Источник: arXiv cs.CL ↗
