Суть открытия: «Когнитивное пространство» внутри модели
В статье, опубликованной 6 июля 2026 года, эксперт по интерпретируемости ИИ Неел Нанда (Neel Nanda) анализирует новую работу Anthropic. Главный вывод исследования: в трансформерах существует так называемое «когнитивное пространство» (cognitive space) — аналог рабочей памяти, где во время прямого прохода (forward pass) хранятся промежуточные переменные и этапы рассуждения. Это не просто теоретическая конструкция, а физически измеримая область в активациях модели.
Нанда подтверждает, что этот феномен наблюдается даже в моделях, не разработанных Anthropic. Авторы исследования и рецензент успешно воспроизвели ключевые выводы на модели Qwen 3.6 27B, что доказывает универсальность явления для современных больших языковых моделей.
Технология J-Lens: как заглянуть в «мозг» ИИ
Для доступа к этому скрытому пространству Anthropic разработала метод J-Lens. В отличие от традиционного Logit Lens, который проецирует активации напрямую на словарь, J-Lens применяет якобиан (Jacobian) к выходным слоям, а затем использует нормализацию и unembedding. Это позволяет точнее выделять векторы, соответствующие конкретным концепциям или промежуточным шагам логики.
Метод позиционируется как инструмент для аудита безопасности (alignment audits). Он помогает генерировать гипотезы о странном поведении модели, хотя Нанда предупреждает: метод не идеален и может давать ложные срабатывания. Тем не менее, он значительно превосходит существующие аналоги по соотношению цена/качество.
Сравнение методов интерпретации
Исследование сравнивает эффективность различных подходов к анализу внутренних состояний моделей. J-Lens демонстрирует лучшие результаты в выявлении «рабочей памяти» модели.
| Метод | Описание | Преимущества | Недостатки |
|---|---|---|---|
| J-Lens | Применение якобиана + нормализация слоя + unembedding | Высокая точность выделения когнитивных векторов; вычислительно доступен (10 проходов по 128 токенов) | Не идеален; возможны ложные срабатывания |
| Logit Lens | Прямая проекция активаций на логиты | Простота реализации | Меньшая точность в сравнении с J-Lens; шум в промежуточных слоях |
| SAE / Autoencoders | Спарсеные автоэнкодеры | Стандарт индустрии для декомпозиции | Сложнее в настройке и использовании по сравнению с J-Lens |
Почему это важно для безопасности ИИ
Существование «рабочей памяти» означает, что мы можем отслеживать ход мыслей модели в реальном времени. Нанда приводит пример: при решении задачи «Майкл Джордан играет в...» модель сначала идентифицирует сущность, затем извлекает факт о виде спорта, и только потом генерирует ответ. J-Lens позволяет увидеть эти промежуточные шаги.
Более того, исследователи обнаружили «мета-токены» — абстрактные представления, которые активируются при обработке неоднозначных предложений (например, символы, означающие «что это значит?»). Это открывает путь к созданию более прозрачных и контролируемых систем ИИ, где аудит может проверять не только итоговый ответ, но и процесс его формирования.
Источник: LessWrong ↗
