Проблема «слепой» калибровки
Калибровка традиционно считается золотым стандартом оценки уверенности больших языковых моделей (LLM). Однако новое исследование, представленное на ICML 2026 EIML Workshop, доказывает, что этот подход недостаточен. Текущие методы допускают тривиально несвязные оценщики, зависят от распределения данных и не проверяют, можно ли интерпретировать уверенность модели как последовательную вероятностную функцию.
Авторы — Krish Matta, Atharv Naphade и Andy Zou — утверждают, что оценки уверенности LLM должны удовлетворять условиям когерентных вероятностных убеждений, а не просто минимизировать ошибку.
Фреймворк C1: три оси когерентности
Для решения проблемы исследователи формализовали требования к когерентности по трем осям и операционализировали их как метрики C1:
- Структурная когерентность (Structural Coherence): Логическая связность оценок вероятностей.
- Верность (Faithfulness): Соответствие уверенности фактической точности.
- Полезность (Usefulness): Практическая ценность оценки неопределенности для принятия решений.
Шокирующие цифры: 31% логических ошибок
Самое важное открытие исследования — систематическое нарушение условий когерентности даже в хорошо откалиброванных моделях. Исследователи обнаружили, что модели присваивают более низкую уверенность логически более простым вопросам в 31% случаев. Это прямо противоречит интуиции и указывает на глубинные проблемы в архитектуре или процессе обучения.
Почему стандартные методы не работают
Обычные вмешательства, направленные на снижение RMSCE (Root Mean Squared Calibration Error), не исправляют структурные нарушения. Это доказывает, что калибровка ортогональна вероятностной валидности. Ниже приведено сравнение влияния различных методов обучения на метрики C1:
| Метод / Интервенция | Влияние на Калибровку | Влияние на Структурную Когерентность | Влияние на Полезность (Usefulness) |
|---|---|---|---|
| Базовая калибровка (RMSCE) | Улучшает | Не изменяет (нарушения сохраняются) | Нет данных |
| RLHF (Обучение с подкреплением) | Улучшает | Не восстанавливает когерентность | Улучшает |
| Chain-of-Thought (Цепочка рассуждений) | Улучшает | Не восстанавливает когерентность | Улучшает |
Вывод: конец эры «слепой» уверенности
Результаты показывают, что текущие оценки уверенности LLM не могут быть интерпретированы как когерентные вероятности. Фреймворк C1 предоставляет инструменты для измерения этого разрыва. Для индустрии это означает необходимость перехода от простой калибровки к проверке вероятностной согласованности, особенно в критически важных приложениях, где цена ошибки высока.
Источник: arXiv cs.AI ↗
