Суть проблемы: «Знаю, но не говорю»
Команда исследователей (Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk) опубликовала работу, вскрывающую критический разрыв в работе современных LLM. Оказалось, что линейные зонды (linear probes) способны детектировать «испорченный» контекст с почти идеальной точностью. Однако эта способность не конвертируется в надежное предсказание ошибок в финальном ответе. Модель «знает», что контекст нарушен, но не может или не хочет корректно это вербализовать через метрики уверенности.
Эксперимент: Многошаговые арифметические цепочки
Авторы тестировали модели на задачах с многошаговыми арифметическими вычислениями, где легко вносить искажения в промежуточные данные. Ключевые выводы:
- Зонды vs Ответы: Зонды, успешно обнаруживающие искажения, оказались бесполезны для прогнозирования правильности итогового ответа.
- Коллапс уверенности: Модели, принужденные к структурированному формату уверенности, сводят свои ответы к двум значениям. При этом уровни ошибок для этих значений неразличимы, что делает уверенность бесполезной метрикой.
- Гипотеза «Persistence beats peak» опровергнута: Ожидание, что устойчивость сигнала зонда на разных шагах лучше отделяет правильные ответы от ошибочных, не подтвердилось.
Интервенции: Что работает, а что ломает
Исследование оценило эффективность мониторинга в реальном времени. Результаты сильно зависят от архитектуры модели и типа ошибки. Ниже приведено сравнение стратегий вмешательства:
| Стратегия | Эффективность | Риски (Breakage Rate) |
|---|---|---|
| Branch-and-pick | Чистый положительный эффект (net-positive) для всех моделей | Не ломает правильные цепочки (на Llama-3.1-8B: 4 спасенных, 0 сломанных) |
| Reprompt | Спорная эффективность | Ломает правильные цепочки с той же частотой, с какой спасает ошибочные |
| Replace-prior | Спорная эффективность | Аналогично reprompt: высокий риск разрушения валидных выводов |
Вывод для индустрии
Проблема обобщается на разные семейства моделей, включая reasoning-модели. Линейные зонды — необходимый, но недостаточный инструмент. Не существует универсального решения: развертывание требует модели-зависимой маршрутизации, учитывающей тип ошибки. Слепое доверие вербализованной уверенности опасно, а слепое доверие зондам без правильной интервенции — неэффективно.
Источник: arXiv cs.AI ↗
