Исследования7 июля 2026 г., 00:16 МСК🤖 Auto

Anthropic представила J-Lens: прорыв в интерпретируемости ИИ

Неел Нанда опубликовал детальный разбор новой работы Anthropic о «глобальном рабочем пространстве» моделей. Метод J-Lens позволяет заглядывать во внутреннюю «память» нейросетей, выявляя промежуточные вычисления.

Баннер новости 2991

Суть открытия: «Когнитивное пространство» внутри модели

В статье, опубликованной 6 июля 2026 года, эксперт по интерпретируемости ИИ Неел Нанда (Neel Nanda) анализирует новую работу Anthropic. Главный вывод исследования: в трансформерах существует так называемое «когнитивное пространство» (cognitive space) — аналог рабочей памяти, где во время прямого прохода (forward pass) хранятся промежуточные переменные и этапы рассуждения. Это не просто теоретическая конструкция, а физически измеримая область в активациях модели.

Нанда подтверждает, что этот феномен наблюдается даже в моделях, не разработанных Anthropic. Авторы исследования и рецензент успешно воспроизвели ключевые выводы на модели Qwen 3.6 27B, что доказывает универсальность явления для современных больших языковых моделей.

Технология J-Lens: как заглянуть в «мозг» ИИ

Для доступа к этому скрытому пространству Anthropic разработала метод J-Lens. В отличие от традиционного Logit Lens, который проецирует активации напрямую на словарь, J-Lens применяет якобиан (Jacobian) к выходным слоям, а затем использует нормализацию и unembedding. Это позволяет точнее выделять векторы, соответствующие конкретным концепциям или промежуточным шагам логики.

Метод позиционируется как инструмент для аудита безопасности (alignment audits). Он помогает генерировать гипотезы о странном поведении модели, хотя Нанда предупреждает: метод не идеален и может давать ложные срабатывания. Тем не менее, он значительно превосходит существующие аналоги по соотношению цена/качество.

Сравнение методов интерпретации

Исследование сравнивает эффективность различных подходов к анализу внутренних состояний моделей. J-Lens демонстрирует лучшие результаты в выявлении «рабочей памяти» модели.

Метод Описание Преимущества Недостатки
J-Lens Применение якобиана + нормализация слоя + unembedding Высокая точность выделения когнитивных векторов; вычислительно доступен (10 проходов по 128 токенов) Не идеален; возможны ложные срабатывания
Logit Lens Прямая проекция активаций на логиты Простота реализации Меньшая точность в сравнении с J-Lens; шум в промежуточных слоях
SAE / Autoencoders Спарсеные автоэнкодеры Стандарт индустрии для декомпозиции Сложнее в настройке и использовании по сравнению с J-Lens

Почему это важно для безопасности ИИ

Существование «рабочей памяти» означает, что мы можем отслеживать ход мыслей модели в реальном времени. Нанда приводит пример: при решении задачи «Майкл Джордан играет в...» модель сначала идентифицирует сущность, затем извлекает факт о виде спорта, и только потом генерирует ответ. J-Lens позволяет увидеть эти промежуточные шаги.

Более того, исследователи обнаружили «мета-токены» — абстрактные представления, которые активируются при обработке неоднозначных предложений (например, символы, означающие «что это значит?»). Это открывает путь к созданию более прозрачных и контролируемых систем ИИ, где аудит может проверять не только итоговый ответ, но и процесс его формирования.

Источник: LessWrong ↗