Исследования11 августа 2026 г., 08:17 МСК🤖 Auto

Провал доверия: почему линейные зонды видят ошибки, а уверенность модели — нет

Исследование показывает разрыв между внутренним знанием модели и её вербализацией: линейные зонды с точностью, близкой к 100%, обнаруживают искажения контекста, но не предсказывают правильность ответа, а уверенность моделей коллапсирует до двух значе

Баннер новости 5499

Суть проблемы: «Знаю, но не говорю»

Команда исследователей (Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk) опубликовала работу, вскрывающую критический разрыв в работе современных LLM. Оказалось, что линейные зонды (linear probes) способны детектировать «испорченный» контекст с почти идеальной точностью. Однако эта способность не конвертируется в надежное предсказание ошибок в финальном ответе. Модель «знает», что контекст нарушен, но не может или не хочет корректно это вербализовать через метрики уверенности.

Эксперимент: Многошаговые арифметические цепочки

Авторы тестировали модели на задачах с многошаговыми арифметическими вычислениями, где легко вносить искажения в промежуточные данные. Ключевые выводы:

  • Зонды vs Ответы: Зонды, успешно обнаруживающие искажения, оказались бесполезны для прогнозирования правильности итогового ответа.
  • Коллапс уверенности: Модели, принужденные к структурированному формату уверенности, сводят свои ответы к двум значениям. При этом уровни ошибок для этих значений неразличимы, что делает уверенность бесполезной метрикой.
  • Гипотеза «Persistence beats peak» опровергнута: Ожидание, что устойчивость сигнала зонда на разных шагах лучше отделяет правильные ответы от ошибочных, не подтвердилось.

Интервенции: Что работает, а что ломает

Исследование оценило эффективность мониторинга в реальном времени. Результаты сильно зависят от архитектуры модели и типа ошибки. Ниже приведено сравнение стратегий вмешательства:

Стратегия Эффективность Риски (Breakage Rate)
Branch-and-pick Чистый положительный эффект (net-positive) для всех моделей Не ломает правильные цепочки (на Llama-3.1-8B: 4 спасенных, 0 сломанных)
Reprompt Спорная эффективность Ломает правильные цепочки с той же частотой, с какой спасает ошибочные
Replace-prior Спорная эффективность Аналогично reprompt: высокий риск разрушения валидных выводов

Вывод для индустрии

Проблема обобщается на разные семейства моделей, включая reasoning-модели. Линейные зонды — необходимый, но недостаточный инструмент. Не существует универсального решения: развертывание требует модели-зависимой маршрутизации, учитывающей тип ошибки. Слепое доверие вербализованной уверенности опасно, а слепое доверие зондам без правильной интервенции — неэффективно.

Источник: arXiv cs.AI ↗