Проблема «инфляции доверия»
В статье, представленной на GEM Workshop ACL 2026, авторы Sankalp и Shlok Gilda описывают феномен trust inflation (инфляции доверия). Современные оценки языковых моделей (LLM) агрегируют разнородные сигналы: от автоматических метрик до оценки человеком (LLM-as-judge). При простом усреднении (mean aggregation) общая уверенность в результате может многократно превышать надежность самого слабого компонента. Это создает ложное чувство точности.
Оценки как «скоропортящиеся» знания
Авторы предлагают рассматривать результаты тестирования не как абсолютную истину, а как эпистемические утверждения с тремя критическими свойствами:
- Формальность (Formality): Оценка человеком дает более сильное доказательство, чем автоматический метрик.
- Область применения (Scope): Результат бенчмарка применим только к протестированному распределению данных, а не универсально.
- Срок годности (Validity windows): Результаты «истекают» из-за загрязнения данных (contamination) и сдвига распределений.
Эмпирическое доказательство: HELM Leaderboard
Самый яркий аргумент авторов — анализ публичного лидерборда HELM. Исследователи сравнили рейтинги 54 передовых моделей в 10 сценариях, используя два подхода: усреднение всех баллов и метод «наихудшего звена» (weakest-link aggregation). Разрыв оказался радикальным.
| Критерий ранжирования | Количество моделей | Совпадение с другим методом | Суть метода |
|---|---|---|---|
| Средний балл (Mean Score) | 54 модели | 0% (полное несовпадение) | Усреднение всех метрик, скрывающее слабые места |
| Наихудшее звено (Weakest-link) | 54 модели | 0% (полное несовпадение) | Рейтинг определяется самым низким показателем модели |
Топ-5 моделей, лидирующих по среднему баллу, полностью disjoint (не пересекается) с топ-5 моделей, выбранных по методу наихудшего звена. Это доказывает, что усреднение маскирует критические уязвимости моделей.
Предложение: Метаданные оценки
Вместо того чтобы полагаться на единый числовой рейтинг, авторы предлагают внедрить в результаты тестирования явные метаданные. Каждый результат должен содержать:
- Уровень формальности (tier).
- Декларацию области применения (scope).
- Дату истечения срока действия (expiration date).
Такой подход делает эпистемический статус оценки прозрачным и защищает индустрию от принятия решений на основе «просроченных» или статистически некорректных данных.
Источник: arXiv cs.AI ↗
