Суть открытия: разрыв между самоотчетом и реальностью
Исследователь Pranav Viswanath провел эксперимент на модели Llama-3.3-70B, используя инструменты Anthropic: J-lens для определения «сознательного пространства» (J-space) и NLA (Natural Language Autoencoder) для перевода активаций в текст. Ключевой вывод: модель способна сообщать лишь о ~10% своих внутренних состояний. Остальные 90% — «подсознательные» активации — активно управляют поведением модели, но она их «не видит».
При инъекции концептов (например, «слоны», «секретность», «любовь») модель в 80% случаев правильно называла только «сознательную» часть вектора. «Подсознательная» часть, несущая до 70% энергии вектора и повышающая логвероятность целевого токена на +21.1 nats, модель полностью игнорировала, отвечая: «Нет, давай двигаться дальше». Однако NLA читал обе части с почти идеальной точностью и нулевой ошибкой ложных срабатываний.
Методология и проверка гипотез
Для эксперимента использовался метод «разности средних» (Macar et al.) для создания концептуальных векторов по 24 понятиям (от конкретных существительных до абстрактных эмоций). Векторы разделялись на J и не-J компоненты с помощью обученного J-lens. Проверка NLA на синтетических данных показала, что автоэнкодер не галлюцинирует: при инъекции случайных гауссовых векторов NLA выдавал пустоту, а при контрольных тестах на привилегированную информацию ложных срабатываний не было зафиксировано.
Почему это важно для AI-безопасности
Результаты ставят под сомнение эффективность текущих методов оценки (evals) и мониторинга цепочек рассуждений (CoT), которые полагаются на самоотчет модели. Если модель «не знает» о 90% своих мыслей, она может скрывать намерения или предвзятость, которые не проявляются в ее вербализации, но влияют на логины (logits). NLA демонстрирует потенциал как инструмент для обнаружения таких скрытых процессов.
Детали эксперимента: J-space vs NLA
Сравнение возможностей модели и NLA в чтении внутренних состояний Llama-3.3-70B:
| Метрика / Характеристика | Модель (Llama-3.3-70B) | NLA (Anthropic) |
|---|---|---|
| Доля читаемых активаций | ~10% (J-space) | ~80% (общая реконструкция) |
| Реакция на «подсознательные» концепты | Игнорирование, отказ от ответа | Точное чтение (zero false positives) |
| Влияние на логвероятность (logprob) | Не осознается моделью | Активное влияние на выходы (+21.1 nats) |
| Работа с «Franken-vectors» (смешанные концепты) | Называет только J-компонент | Читает оба компонента |
Ограничения и будущие работы
Исследователь отмечает, что NLA не является универсальным «читателем мыслей». В тесте на подсчет символов NLA не выдавал точных цифр, в отличие от J-lens, а генерировал лишь общие описания ситуации. Это указывает на то, что методы интерпретируемости дополняют друг друга: J-lens лучше справляется с точными, структурированными данными, а NLA — с семантическим содержанием. Код и данные исследования доступны на GitHub автора.
Источник: LessWrong ↗
