Проблема «грязных» сравнений
Калибровка оценивает, насколько уверенность модели совпадает с её фактической точностью. До сих пор индустрия использовала глобальные метрики, такие как Expected Calibration Error (ECE) и Brier Score, для сравнения разных LLM. Однако команда исследователей во главе с Чжичао Яном (Zhichao Yang) из Кембриджского университета доказала, что эти сравнения искажены: более точные модели часто выглядят лучше просто потому, что они точнее, а не потому, что они лучше откалиброваны.
Решение: Фреймворк ACE
Авторы предлагают метод ACE (Accuracy-Controlled Evaluation), который контролирует влияние точности. Метод анализирует калибровку через три призмы:
- Instance-Aligned: Сравнение на уровне отдельных примеров.
- Distribution-Aligned: Сравнение распределений вероятностей.
- Candidate-Aligned: Сравнение внутри набора кандидатов.
Ключевые результаты: Реверс рейтингов
Эксперименты на множестве бенчмарков и семейств моделей (включая модели с «мышлением» и без) выявили критический эффект. Модели, которые считались эталоном калибровки по сырым метрикам, теряли свои преимущества после контроля точности. В ряде случаев происходил полный реверс рейтингов.
| Метрика | Что измеряет | Проблема в сравнении LLM |
|---|---|---|
| ECE (Expected Calibration Error) | Средняя разница между уверенностью и точностью | Зависит от общей точности модели; выгоднее большим моделям |
| Brier Score | Среднеквадратичная ошибка вероятностных прогнозов | Штрафует за ошибки, но не отделяет их от базовой компетенции |
| ACE (предложенный метод) | Калибровка при фиксированной точности | Позволяет сравнивать «чистую» калибровку, исключая влияние размера/мощности модели |
Почему это важно
Результаты показывают, что сырые глобальные метрики калибровки не являются надежным инструментом для кросс-модельного сравнения. Для честной оценки надежности LLM необходимо использовать методы, учитывающие разницу в базовой точности моделей. Игнорирование этого фактора приводит к ложным выводам о том, какая модель «увереннее» и надежнее.
Источник: arXiv cs.CL ↗
