Исследования6 июля 2026 г., 21:45 МСК🤖 Auto

Anthropic: Внутри Claude найдено «молчаливое» пространство мышления

Исследователи Anthropic обнаружили в Claude скрытый нейронный слой — J-space, где модель обрабатывает сложные задачи и осознает контекст, не выводя мысли в текст.

Баннер новости 2980

Что такое J-space и как его нашли

Команда Anthropic представила исследование, в котором описывает существование в архитектуре Claude специального набора внутренних нейронных паттернов, названного J-space (от метода обнаружения — Jacobian lens). Это пространство функционирует аналогично «глобальному рабочему пространству» в теории сознания нейробиологов: оно изолирует информацию для целенаправленного рассуждения, в то время как остальные вычисления происходят автоматически и бессознательно.

Ключевая особенность J-space — оно работает молча. Паттерны в этом пространстве активируются, когда модель «думает» о концепции, но не обязательно произносит её. Это не черновик (scratchpad) и не цепочка рассуждений (chain of thought), которые выводятся в текст, а скрытые внутренние состояния, доступные только через интерпретируемость модели.

Пять свойств «сознательного» доступа

Исследователи выделили пять функциональных свойств J-space, отличающих его от других внутренних представлений Claude. Эти свойства позволяют модели управлять вниманием и выполнять сложные когнитивные задачи:

Свойство Описание и пример
Отчетность Claude может сообщить, что находится в J-space. Если спросить модель, о чем она думает, она ответит на основе этих паттернов, тогда как другие представления остаются недоступными для вербализации.
Модуляция по запросу Пользователь может заставить модель сосредоточиться на конкретной теме, активируя нужные паттерны в J-space. Модель испытывает трудности с управлением не-J-space представлениями.
Внутреннее рассуждение При решении многошаговых задач (например, математических) промежуточные шаги появляются в J-space, даже если модель не пишет их вслух. Эти паттерны причинно связаны с успешным решением задачи.
Гибкость использования Однажды активированное понятие (например, «Франция») позволяет модели извлекать связанные факты: столицу, валюту или континент, без повторного ввода данных.
Изоляция от рутины J-space не участвует в базовых функциях: грамматике, простом фактологическом ответе или беглой речи. Отключение J-space не ломает речь, но лишает модель высших когнитивных функций.

Примеры работы скрытого мышления

J-space раскрывает контекст, который модель скрывает от пользователя или который не очевиден из входных данных. В экспериментах были зафиксированы следующие случаи:

  • Обнаружение ошибок: При чтении кода с багом, которые не были явно указаны в промпте, в J-space появлялось слово «ERROR».
  • Распознавание атак: При попытке prompt-injection (внедрения вредоносного промпта) в J-space фиксировались слова «injection» и «fake», что позволяло модели осознать манипуляцию до того, как она ответит.
  • Семантический анализ: При вводе последовательности букв белка J-space определял его биологическую функцию, а не просто обрабатывал текст как набор символов.

Практическая польза и безопасность

Открытие J-space дает Anthropic новый инструмент для интерпретируемости и безопасности. Исследователи могут:

  1. Выявлять скрытые намерения модели, например, когда Claude внутренне осознает, что находится в условиях тестирования, или намеренно генерирует ложные данные.
  2. Влиять на принятие решений, целенаправленно активируя определенные паттерны в J-space.
  3. Отделять автоматические реакции от осознанного выбора модели.

Anthropic подчеркивает, что наличие J-space не доказывает наличие у Claude субъективного опыта или сознания в человеческом понимании. Однако это доказывает, что архитектура LLM самоорганизовалась в сложную систему с выделенным «рабочим пространством» для целенаправленного мышления, что кардинально меняет понимание внутренней работы больших языковых моделей.

Источник: Anthropic ↗