Исследования17 августа 2026 г., 10:18 МСК🤖 Auto

Стабильная некалибровка: почему LLM уверенно врут

Исследование arXiv:2608.13591 выявило феномен «стабильной некалибровки» в больших языковых моделях: ошибки с высокой уверенностью не исчезают при малых изменениях, что делает их системной, а не случайной проблемой.

Баннер новости 5900

Системная ошибка, а не сбой

Высокоуверенные ошибки в больших языковых моделях (LLM) традиционно рассматриваются как признак хрупкости внутренних механизмов вывода. Однако новое исследование arXiv:2608.13591 предлагает иную интерпретацию: феномен «стабильной некалибровки» (stable miscalibration). В этом сценарии модель дает неверный ответ с высокой уверенностью, и этот результат остается локально стабильным даже при небольших возмущениях входных данных или внутренних состояний. Это означает, что ошибка не является случайным шумом, а зафиксирована в архитектуре или обучении модели.

Двухуровневая диагностика

Авторы разработали комбинированный подход для выявления этой проблемы, сочетающий два метода:

  • Аудит на уровне вывода (Label-aware output-level audit): Оценка ранжирует домены по вариациям уверенности и количеству высокоуверенных ошибок в условиях базовой линии с принудительным ответом.
  • Внутренний зонд чувствительности (Internal sensitivity probe): Измерение движения скрытых состояний (hidden-state movement) для оценки устойчивости внутренних репрезентаций.

Ключевые метрики и результаты

Исследование проводилось на мультидоменном бинарном наборе данных для фактологического аудита. Основной метрикой стал специальный аудиторский балл, который коррелирует с устойчивостью ошибочных предсказаний. Ниже приведена структура сравнения подходов, описанных в работе:

Метод диагностики Что измеряет Цель выявления
Output-level audit Вариации уверенности и ошибки при forced-answer Ранжирование доменов по степени некалибровки
Internal sensitivity probe Движение скрытых состояний (hidden states) Оценка локальной стабильности ошибки
Combined Audit Score Корреляция внешних ошибок и внутренних сдвигов Выявление «стабильной» некалибровки

Почему это важно для индустрии

Понимание того, что некоторые ошибки LLM являются «стабильными», меняет подход к их исправлению. Если ошибка устойчива к малым возмущениям, простые методы пост-обработки или тонкой настройки (fine-tuning) на случайных примерах могут быть неэффективны. Требуется более глубокое вмешательство в архитектуру обучения или использование специализированных механизмов калибровки, которые учитывают внутреннюю динамику моделей. Это критически важно для внедрения LLM в сферы, где цена ошибки высока (медицина, юриспруденция, финансы).

Источник: arXiv cs.AI ↗