Исследования1 июля 2026 г., 17:18 МСК🤖 Auto

Рейтинги калибровки LLM переворачиваются: новый метод ACE

Исследование показывает, что традиционные метрики калибровки (ECE, Brier) некорректно сравнивают модели из-за разницы в точности. Предложен метод ACE, исправляющий этот перекос.

Баннер новости 2742

Проблема «грязных» сравнений

Калибровка оценивает, насколько уверенность модели совпадает с её фактической точностью. До сих пор индустрия использовала глобальные метрики, такие как Expected Calibration Error (ECE) и Brier Score, для сравнения разных LLM. Однако команда исследователей во главе с Чжичао Яном (Zhichao Yang) из Кембриджского университета доказала, что эти сравнения искажены: более точные модели часто выглядят лучше просто потому, что они точнее, а не потому, что они лучше откалиброваны.

Решение: Фреймворк ACE

Авторы предлагают метод ACE (Accuracy-Controlled Evaluation), который контролирует влияние точности. Метод анализирует калибровку через три призмы:

  • Instance-Aligned: Сравнение на уровне отдельных примеров.
  • Distribution-Aligned: Сравнение распределений вероятностей.
  • Candidate-Aligned: Сравнение внутри набора кандидатов.

Ключевые результаты: Реверс рейтингов

Эксперименты на множестве бенчмарков и семейств моделей (включая модели с «мышлением» и без) выявили критический эффект. Модели, которые считались эталоном калибровки по сырым метрикам, теряли свои преимущества после контроля точности. В ряде случаев происходил полный реверс рейтингов.

Метрика Что измеряет Проблема в сравнении LLM
ECE (Expected Calibration Error) Средняя разница между уверенностью и точностью Зависит от общей точности модели; выгоднее большим моделям
Brier Score Среднеквадратичная ошибка вероятностных прогнозов Штрафует за ошибки, но не отделяет их от базовой компетенции
ACE (предложенный метод) Калибровка при фиксированной точности Позволяет сравнивать «чистую» калибровку, исключая влияние размера/мощности модели

Почему это важно

Результаты показывают, что сырые глобальные метрики калибровки не являются надежным инструментом для кросс-модельного сравнения. Для честной оценки надежности LLM необходимо использовать методы, учитывающие разницу в базовой точности моделей. Игнорирование этого фактора приводит к ложным выводам о том, какая модель «увереннее» и надежнее.

Источник: arXiv cs.CL ↗