Исследования5 октября 2026 г., 13:19 МСК🤖 Auto

LLM-судьи не умеют считать: почему ранжирование не равно качеству

Исследование MIT показывает, что LLM-модераторы верно ранжируют ответы, но катастрофически ошибаются в оценке их приемлемости для рабочих мест. Разрыв между мнением ИИ и людей достигает 90%.

Баннер новости 8941

Суть проблемы: порядок против масштаба

Исследователи Гарри Лю (Harry Lyu) и Нил Томпсон (Neil Thompson) из MIT провели аудит 33 конфигураций LLM-судей (LLM Judges), которые всё чаще используются для оценки качества AI-ответов в профессиональной среде. Главная находка статьи «Right Order, Wrong Scale» заключается в том, что высокая корреляция в ранжировании (кто лучше, кто хуже) не гарантирует правильности оценки абсолютного качества (сколько ответов вообще допустимо).

Для аудита была создана база O*NET-BENCH, основанная на 45 796 реальных оценках работников. На 4 501 тестовом примере проверялись шесть семейств моделей. Результат оказался парадоксальным: 25 конфигураций показали точность парного сравнения (tie-aware pair accuracy) на уровне 0.60 и выше, что кажется хорошим показателем. Однако простой базовый метод TF-IDF, обученный на тренировочных данных, почти догнал сильнейших LLM-судей.

Колоссальный разрыв в оценках

Самый важный вывод исследования касается долей приемлемых ответов. LLM-судьи демонстрируют огромную вариабельность в оценке того, какой процент ответов считается «хорошим»:

Показатель Значение Комментарий
Доля приемлемых ответов по LLM 3.0% – 97.9% Огромный разброс: от почти полного отказа до одобрения всего
Доля приемлемых ответов по людям 61.1% Референсное значение, основанное на опросах работников
Объясненная дисперсия (после калибровки) до 8.5% Даже после устранения систематической ошибки, LLM плохо предсказывают индивидуальные оценки

Это означает, что если вы используете LLM для принятия кадровых решений или оценки качества контента, вы можете получить совершенно искаженную картину реальности, даже если модель «правильно» расставляет ответы по местам.

Провал тонкой настройки (Fine-tuning)

Авторы обнаружили, что попытки улучшить модели через тонкую настройку могут усугубить проблему. В одной из линий моделей переход от точечного оценивания (pointwise scoring) к пакетному few-shot/listwise протоколу улучшил ранжирование, но снизил согласие с мнением людей на уровне задач и профессий. Этот эффект воспроизвелся на независимом наборе данных, что указывает на фундаментальное несоответствие метрик оптимизации и реальной ценности.

Вывод для индустрии

Исследование ставит под сомнение слепое доверие к LLM-судьям в контексте occupational AI measurement. Ранжирование (ranking agreement) — недостаточный критерий. Для использования в профессиональной среде модели должны валидироваться не только по тому, «кто лучше», но и по тому, насколько точно они оценивают уровень приемлемости (acceptance rates) и агрегированные показатели, которые будут использоваться для принятия решений.

Источник: arXiv cs.AI ↗