Проблема: Точность без калибровки и верности
Большие языковые модели, дообученные для прогнозирования (forecasting), часто демонстрируют высокую точность, но плохую калибровку. Это означает, что модель может быть уверена в неверном ответе. Кроме того, их рассуждения в формате Chain-of-Thought (CoT) могут быть неискренними: модель генерирует логическую цепочку, которая не отражает реальные доказательства, заложенные в промпт. Авторы исследования задались вопросом: можно ли заглянуть «внутрь» модели, чтобы увидеть истинную уверенность и факты?
Методология: Зондирование внутренних представлений
Команда исследователей (Raphaël Sarfati и соавторы) использовала модели Eternis-Forecaster 8B на датасете OpenForesight, а также протестировала GLM-4.7-Flash и GLM-4.5-Air. Они обучили зонды (probes) на промежуточных активациях нейросети. Эти зонды анализируют внутренние состояния модели, а не только её текстовый вывод.
Ключевые результаты: Зонды как детекторы лжи
Внутренние представления оказались надежнее текстовых рассуждений. Исследователи провели два теста:
- Абляция доказательств: Удаление важного источника информации в промпте часто меняло прогноз модели, но текст рассуждений оставался прежним. Зонды же фиксировали сдвиг в уверенности.
- Внедрение отвлекающих факторов: Зонды предсказали направление изменения прогноза в 84% случаев, даже когда CoT намеренно скрывал влияние искажений.
| Метрика / Модель | Результат / Наблюдение |
|---|---|
| Предсказание направления изменения | 84% точности (включая случаи скрытого влияния) |
| Экономия токенов (Routing) | 30-47% (без потери точности) |
| Калибровка (Eternis-Forecaster 8B) | Существенное улучшение через зондирование активаций |
| GLM-4.7-Flash / GLM-4.5-Air | Результаты калибровки подтверждены на этих моделях |
Открытие: Ответы формируются до рассуждений
Самое интригующее открытие — forced answering. Оказалось, что прогноз и уровень уверенности фиксируются в модели задолго до начала генерации текста. Один проход по сети до начала рассуждений позволяет восстановить «заранее решенный» ответ. Это позволяет маршрутизировать запросы: если распределение вероятностей до рассуждений узкое, модель может выдать ответ сразу, экономя вычислительные ресурсы.
Значение для индустрии
Работа доказывает, что внутренние представления (internal representations) — это практический инструмент для калибровки, аудита и триажа моделей. Вместо того чтобы доверять красивому тексту CoT, разработчики могут использовать зонды для проверки искренности модели и оптимизации затрат на инференс.
Источник: arXiv cs.CL ↗
