Исследования31 июля 2026 г., 09:16 МСК🤖 Auto

Смерть среднего балла: почему оценки LLM — это скоропортящийся продукт

Исследователи доказали, что усреднение метрик в бенчмарках создает иллюзию надежности. Топ-5 моделей по среднему баллу и по самому слабому звену — это совершенно разные списки.

Баннер новости 4786

Проблема «инфляции доверия»

В статье, представленной на GEM Workshop ACL 2026, авторы Sankalp и Shlok Gilda описывают феномен trust inflation (инфляции доверия). Современные оценки языковых моделей (LLM) агрегируют разнородные сигналы: от автоматических метрик до оценки человеком (LLM-as-judge). При простом усреднении (mean aggregation) общая уверенность в результате может многократно превышать надежность самого слабого компонента. Это создает ложное чувство точности.

Оценки как «скоропортящиеся» знания

Авторы предлагают рассматривать результаты тестирования не как абсолютную истину, а как эпистемические утверждения с тремя критическими свойствами:

  • Формальность (Formality): Оценка человеком дает более сильное доказательство, чем автоматический метрик.
  • Область применения (Scope): Результат бенчмарка применим только к протестированному распределению данных, а не универсально.
  • Срок годности (Validity windows): Результаты «истекают» из-за загрязнения данных (contamination) и сдвига распределений.

Эмпирическое доказательство: HELM Leaderboard

Самый яркий аргумент авторов — анализ публичного лидерборда HELM. Исследователи сравнили рейтинги 54 передовых моделей в 10 сценариях, используя два подхода: усреднение всех баллов и метод «наихудшего звена» (weakest-link aggregation). Разрыв оказался радикальным.

Критерий ранжирования Количество моделей Совпадение с другим методом Суть метода
Средний балл (Mean Score) 54 модели 0% (полное несовпадение) Усреднение всех метрик, скрывающее слабые места
Наихудшее звено (Weakest-link) 54 модели 0% (полное несовпадение) Рейтинг определяется самым низким показателем модели

Топ-5 моделей, лидирующих по среднему баллу, полностью disjoint (не пересекается) с топ-5 моделей, выбранных по методу наихудшего звена. Это доказывает, что усреднение маскирует критические уязвимости моделей.

Предложение: Метаданные оценки

Вместо того чтобы полагаться на единый числовой рейтинг, авторы предлагают внедрить в результаты тестирования явные метаданные. Каждый результат должен содержать:

  1. Уровень формальности (tier).
  2. Декларацию области применения (scope).
  3. Дату истечения срока действия (expiration date).

Такой подход делает эпистемический статус оценки прозрачным и защищает индустрию от принятия решений на основе «просроченных» или статистически некорректных данных.

Источник: arXiv cs.AI ↗