Системная ошибка, а не сбой
Высокоуверенные ошибки в больших языковых моделях (LLM) традиционно рассматриваются как признак хрупкости внутренних механизмов вывода. Однако новое исследование arXiv:2608.13591 предлагает иную интерпретацию: феномен «стабильной некалибровки» (stable miscalibration). В этом сценарии модель дает неверный ответ с высокой уверенностью, и этот результат остается локально стабильным даже при небольших возмущениях входных данных или внутренних состояний. Это означает, что ошибка не является случайным шумом, а зафиксирована в архитектуре или обучении модели.
Двухуровневая диагностика
Авторы разработали комбинированный подход для выявления этой проблемы, сочетающий два метода:
- Аудит на уровне вывода (Label-aware output-level audit): Оценка ранжирует домены по вариациям уверенности и количеству высокоуверенных ошибок в условиях базовой линии с принудительным ответом.
- Внутренний зонд чувствительности (Internal sensitivity probe): Измерение движения скрытых состояний (hidden-state movement) для оценки устойчивости внутренних репрезентаций.
Ключевые метрики и результаты
Исследование проводилось на мультидоменном бинарном наборе данных для фактологического аудита. Основной метрикой стал специальный аудиторский балл, который коррелирует с устойчивостью ошибочных предсказаний. Ниже приведена структура сравнения подходов, описанных в работе:
| Метод диагностики | Что измеряет | Цель выявления |
|---|---|---|
| Output-level audit | Вариации уверенности и ошибки при forced-answer | Ранжирование доменов по степени некалибровки |
| Internal sensitivity probe | Движение скрытых состояний (hidden states) | Оценка локальной стабильности ошибки |
| Combined Audit Score | Корреляция внешних ошибок и внутренних сдвигов | Выявление «стабильной» некалибровки |
Почему это важно для индустрии
Понимание того, что некоторые ошибки LLM являются «стабильными», меняет подход к их исправлению. Если ошибка устойчива к малым возмущениям, простые методы пост-обработки или тонкой настройки (fine-tuning) на случайных примерах могут быть неэффективны. Требуется более глубокое вмешательство в архитектуру обучения или использование специализированных механизмов калибровки, которые учитывают внутреннюю динамику моделей. Это критически важно для внедрения LLM в сферы, где цена ошибки высока (медицина, юриспруденция, финансы).
Источник: arXiv cs.AI ↗
