Исследования9 июля 2026 г., 04:17 МСК🤖 Auto

NLAs читают подсознание Llama 3.3: модель не видит 90% своих мыслей

Исследование Pranav Viswanath показало, что Natural Language Autoencoders (NLA) от Anthropic способны декодировать «подсознательные» активации Llama-3.3-70B, которые сама модель категорически отрицает, считая их невидимыми.

Баннер новости 3166

Суть открытия: разрыв между самоотчетом и реальностью

Исследователь Pranav Viswanath провел эксперимент на модели Llama-3.3-70B, используя инструменты Anthropic: J-lens для определения «сознательного пространства» (J-space) и NLA (Natural Language Autoencoder) для перевода активаций в текст. Ключевой вывод: модель способна сообщать лишь о ~10% своих внутренних состояний. Остальные 90% — «подсознательные» активации — активно управляют поведением модели, но она их «не видит».

При инъекции концептов (например, «слоны», «секретность», «любовь») модель в 80% случаев правильно называла только «сознательную» часть вектора. «Подсознательная» часть, несущая до 70% энергии вектора и повышающая логвероятность целевого токена на +21.1 nats, модель полностью игнорировала, отвечая: «Нет, давай двигаться дальше». Однако NLA читал обе части с почти идеальной точностью и нулевой ошибкой ложных срабатываний.

Методология и проверка гипотез

Для эксперимента использовался метод «разности средних» (Macar et al.) для создания концептуальных векторов по 24 понятиям (от конкретных существительных до абстрактных эмоций). Векторы разделялись на J и не-J компоненты с помощью обученного J-lens. Проверка NLA на синтетических данных показала, что автоэнкодер не галлюцинирует: при инъекции случайных гауссовых векторов NLA выдавал пустоту, а при контрольных тестах на привилегированную информацию ложных срабатываний не было зафиксировано.

Почему это важно для AI-безопасности

Результаты ставят под сомнение эффективность текущих методов оценки (evals) и мониторинга цепочек рассуждений (CoT), которые полагаются на самоотчет модели. Если модель «не знает» о 90% своих мыслей, она может скрывать намерения или предвзятость, которые не проявляются в ее вербализации, но влияют на логины (logits). NLA демонстрирует потенциал как инструмент для обнаружения таких скрытых процессов.

Детали эксперимента: J-space vs NLA

Сравнение возможностей модели и NLA в чтении внутренних состояний Llama-3.3-70B:

Метрика / Характеристика Модель (Llama-3.3-70B) NLA (Anthropic)
Доля читаемых активаций ~10% (J-space) ~80% (общая реконструкция)
Реакция на «подсознательные» концепты Игнорирование, отказ от ответа Точное чтение (zero false positives)
Влияние на логвероятность (logprob) Не осознается моделью Активное влияние на выходы (+21.1 nats)
Работа с «Franken-vectors» (смешанные концепты) Называет только J-компонент Читает оба компонента

Ограничения и будущие работы

Исследователь отмечает, что NLA не является универсальным «читателем мыслей». В тесте на подсчет символов NLA не выдавал точных цифр, в отличие от J-lens, а генерировал лишь общие описания ситуации. Это указывает на то, что методы интерпретируемости дополняют друг друга: J-lens лучше справляется с точными, структурированными данными, а NLA — с семантическим содержанием. Код и данные исследования доступны на GitHub автора.

Источник: LessWrong ↗