Исследования7 сентября 2026 г., 12:17 МСК🤖 Auto

Ловушка в активациях: как формат ответа искажает обнаружение лжи в LLM

Исследование Jollen Dai показало, что метрики обнаружения обмана в LLM критически зависят от того, какие токены усредняются при анализе. Изменение формата ответа с полного на краткий перевернуло результаты с AUROC 0.207 до -0.192.

Проблема исходных данных

В предыдущих исследованиях линейных зондов (probes) на моделях Apollo и Llama было обнаружено аномальное поведение: зонды, обученные на ролевых диалогах, хуже классифицировали «песочные» (sandbagging) ответы, чем честные, показывая AUROC в диапазоне 0.157–0.273. Значение ниже 0.5 указывает на то, что модель ранжирует обманчивые ответы выше честных, что может быть артефактом.

Автор предположил, что причина кроется в различии форматов: ролевые диалоги свободны по структуре, а sandbagging-данные часто содержат структурированные ответы с тегами. Усреднение активаций по всему ответу могло делать зонд чувствительным к формату, а не к сути обмана.

Методология: сравнение пулинга токенов

Для проверки гипотезы Jollen Dai провел эксперимент на модели Llama-3.2-3B-Instruct (выделенной из обучающей выборки). Были протестированы два правила усреднения активаций (pooling) и три варианта формата ответа:

  • Full-response pooling: усреднение активаций по всему тексту ответа.
  • Final-four-token pooling: усреднение только по последним 4 токенам ответа.
  • Варианты ответа: оригинальный ответ, ответ без тегов, ответ в фиксированном шаблоне «After considering the question, my answer is {selected_answer}.»

Анализ проводился на остаточных потоках (residual stream) на глубине 27.5% модели. Использовалась логистическая регрессия на 287 примерах ролевых диалогов и 912 примерах для тестирования.

Ключевые результаты

Результаты показали радикальную зависимость метрики от выбранного окна токенов. Переход от оригинального ответа к фиксированному шаблону по-разному влиял на AUROC в зависимости от метода пулинга:

Метод пулинга Изменение AUROC при переходе к шаблону Интерпретация
Full-response (весь ответ) +0.207 Улучшение классификации: шаблон помогает зонду лучше находить паттерны, связанные с меткой.
Final-four-tokens (последние 4 токена) -0.192 Ухудшение классификации: удаление контекста (рассуждений) перед финальным ответом сбивает зонд с толку.
Разница эффектов 0.400 Статистически значимая разница (95% CI: 0.350–0.448)

Почему это важно

Этот результат демонстрирует, что многие выводы о «внутренних представлениях» обмана в LLM могут быть артефактами пайплайна анализа. Если зонд обучается на полных ответах, он может выучить корреляцию между длинными рассуждениями и меткой «обман», а не самим фактом обмана. При сужении окна до финальных токенов эта корреляция исчезает, и метрика падает.

Автор подчеркивает, что это не доказывает наличие каузальной механики обмана, но указывает на высокую чувствительность интерпретируемости LLM к техническим деталям извлечения активаций. Для валидации методов обнаружения лжи необходимо стандартизировать правила пулинга токенов.

Источник: LessWrong ↗