Проблема исходных данных
В предыдущих исследованиях линейных зондов (probes) на моделях Apollo и Llama было обнаружено аномальное поведение: зонды, обученные на ролевых диалогах, хуже классифицировали «песочные» (sandbagging) ответы, чем честные, показывая AUROC в диапазоне 0.157–0.273. Значение ниже 0.5 указывает на то, что модель ранжирует обманчивые ответы выше честных, что может быть артефактом.
Автор предположил, что причина кроется в различии форматов: ролевые диалоги свободны по структуре, а sandbagging-данные часто содержат структурированные ответы с тегами. Усреднение активаций по всему ответу могло делать зонд чувствительным к формату, а не к сути обмана.
Методология: сравнение пулинга токенов
Для проверки гипотезы Jollen Dai провел эксперимент на модели Llama-3.2-3B-Instruct (выделенной из обучающей выборки). Были протестированы два правила усреднения активаций (pooling) и три варианта формата ответа:
- Full-response pooling: усреднение активаций по всему тексту ответа.
- Final-four-token pooling: усреднение только по последним 4 токенам ответа.
- Варианты ответа: оригинальный ответ, ответ без тегов, ответ в фиксированном шаблоне «After considering the question, my answer is {selected_answer}.»
Анализ проводился на остаточных потоках (residual stream) на глубине 27.5% модели. Использовалась логистическая регрессия на 287 примерах ролевых диалогов и 912 примерах для тестирования.
Ключевые результаты
Результаты показали радикальную зависимость метрики от выбранного окна токенов. Переход от оригинального ответа к фиксированному шаблону по-разному влиял на AUROC в зависимости от метода пулинга:
| Метод пулинга | Изменение AUROC при переходе к шаблону | Интерпретация |
|---|---|---|
| Full-response (весь ответ) | +0.207 | Улучшение классификации: шаблон помогает зонду лучше находить паттерны, связанные с меткой. |
| Final-four-tokens (последние 4 токена) | -0.192 | Ухудшение классификации: удаление контекста (рассуждений) перед финальным ответом сбивает зонд с толку. |
| Разница эффектов | 0.400 | Статистически значимая разница (95% CI: 0.350–0.448) |
Почему это важно
Этот результат демонстрирует, что многие выводы о «внутренних представлениях» обмана в LLM могут быть артефактами пайплайна анализа. Если зонд обучается на полных ответах, он может выучить корреляцию между длинными рассуждениями и меткой «обман», а не самим фактом обмана. При сужении окна до финальных токенов эта корреляция исчезает, и метрика падает.
Автор подчеркивает, что это не доказывает наличие каузальной механики обмана, но указывает на высокую чувствительность интерпретируемости LLM к техническим деталям извлечения активаций. Для валидации методов обнаружения лжи необходимо стандартизировать правила пулинга токенов.
Источник: LessWrong ↗