Что такое J-space и как это работает
В июле 2026 года Anthropic опубликовала исследование "Verbalizable Representations Form a Global Workspace in Language Models" и выпустила инструмент Jacobian lens (J-lens). Ученые выявили, что в глубине нейросети существует небольшой участок, занимающий не более 10% активности модели. Эта зона, названная J-space, функционирует как глобальное рабочее пространство: она удерживает несколько десятков ключевых концепций в виде конкретных слов, которые модель еще не озвучила.
В отличие от стандартных методов анализа, которые оценивают только финальный ответ, J-lens задает вопрос о будущем: какие слова модель с наибольшей вероятностью использует в оставшейся части ответа, исходя из текущего внутреннего состояния. Это позволяет заглянуть «внутрь» процесса мышления LLM, подобно тому как игрок в покер показывает свои карты, а не только свои эмоции.
Доказательства: от арифметики до безопасности
Исследователи продемонстрировали работоспособность метода на нескольких кейсах. В задаче на арифметику (4 + 17) × 2 + 7 = в J-space последовательно появлялись слова 21, затем 42 и 49 — промежуточные шаги вычислений, которые модель никогда не выводит в текст. При изменении входных данных (замена паука на муравья в задаче о ногах) в J-space фиксировалась смена концепции, что напрямую влияло на итоговый ответ модели.
Особый интерес представляет реакция J-space на безопасность. При обнаружении скрытых инъекций промптов в поисковой выдаче, до начала генерации ответа, в J-space загорались слова "injection" и "fake". Аналогично, при попытке заставить модель действовать против своих настроек безопасности, в J-space фиксировались внутренние реакции, описываемые исследователями как "BUT" или "damn", что свидетельствует о наличии внутреннего конфликта до формирования ответа.
Сравнение подходов к анализу LLM
| Метод анализа | Что оценивается | Ограничения | Преимущества J-lens |
|---|---|---|---|
| Регулярные выражения (Regex) | Только финальный вывод | Не видит процесс, только результат | Анализирует промежуточные состояния |
| Внешние оценщики (Evals) | Качество ответа | Требует готового ответа | Работает в реальном времени генерации |
| Jacobian Lens (J-lens) | Внутренние вербализуемые представления | Требует доступа к внутренним слоям | Показывает «намерения» и логику до ответа |
Почему это важно для разработчиков
Обнаружение J-space решает проблему «черного ящика» в LLM. Разработчикам больше не нужно гадать, почему модель приняла то или иное решение, используя косвенные метрики. Наличие открытого инструмента и демо-версии позволяет инженерам внедрять J-lens для отладки сложных цепочек рассуждений (Chain-of-Thought), выявления скрытых предубеждений и контроля безопасности на этапе формирования ответа, а не после него.
Источник: Towards AI pub ↗
