Исследования25 июля 2026 г., 18:17 МСК🤖 Auto

Anthropic открыла «мысленный блокнот» Claude: J-lens читает скрытые мысли модели

Исследователи из Anthropic обнаружили в моделях Claude специализированную зону (J-space), где внутренние вычисления фиксируются в виде обычных слов. Новый инструмент J-lens позволяет видеть эти «невысказанные» мысли до генерации ответа.

Баннер новости 4380

Что такое J-space и как это работает

В июле 2026 года Anthropic опубликовала исследование "Verbalizable Representations Form a Global Workspace in Language Models" и выпустила инструмент Jacobian lens (J-lens). Ученые выявили, что в глубине нейросети существует небольшой участок, занимающий не более 10% активности модели. Эта зона, названная J-space, функционирует как глобальное рабочее пространство: она удерживает несколько десятков ключевых концепций в виде конкретных слов, которые модель еще не озвучила.

В отличие от стандартных методов анализа, которые оценивают только финальный ответ, J-lens задает вопрос о будущем: какие слова модель с наибольшей вероятностью использует в оставшейся части ответа, исходя из текущего внутреннего состояния. Это позволяет заглянуть «внутрь» процесса мышления LLM, подобно тому как игрок в покер показывает свои карты, а не только свои эмоции.

Доказательства: от арифметики до безопасности

Исследователи продемонстрировали работоспособность метода на нескольких кейсах. В задаче на арифметику (4 + 17) × 2 + 7 = в J-space последовательно появлялись слова 21, затем 42 и 49 — промежуточные шаги вычислений, которые модель никогда не выводит в текст. При изменении входных данных (замена паука на муравья в задаче о ногах) в J-space фиксировалась смена концепции, что напрямую влияло на итоговый ответ модели.

Особый интерес представляет реакция J-space на безопасность. При обнаружении скрытых инъекций промптов в поисковой выдаче, до начала генерации ответа, в J-space загорались слова "injection" и "fake". Аналогично, при попытке заставить модель действовать против своих настроек безопасности, в J-space фиксировались внутренние реакции, описываемые исследователями как "BUT" или "damn", что свидетельствует о наличии внутреннего конфликта до формирования ответа.

Сравнение подходов к анализу LLM

Метод анализа Что оценивается Ограничения Преимущества J-lens
Регулярные выражения (Regex) Только финальный вывод Не видит процесс, только результат Анализирует промежуточные состояния
Внешние оценщики (Evals) Качество ответа Требует готового ответа Работает в реальном времени генерации
Jacobian Lens (J-lens) Внутренние вербализуемые представления Требует доступа к внутренним слоям Показывает «намерения» и логику до ответа

Почему это важно для разработчиков

Обнаружение J-space решает проблему «черного ящика» в LLM. Разработчикам больше не нужно гадать, почему модель приняла то или иное решение, используя косвенные метрики. Наличие открытого инструмента и демо-версии позволяет инженерам внедрять J-lens для отладки сложных цепочек рассуждений (Chain-of-Thought), выявления скрытых предубеждений и контроля безопасности на этапе формирования ответа, а не после него.

Источник: Towards AI pub ↗