Исследования6 июля 2026 г., 21:15 МСК🤖 Auto

Anthropic: В Claude обнаружен «глобальный рабочий стол» для осознанного мышления

Исследователи из Anthropic выявили в моделях Claude специализированный нейронный слой — J-space, который функционирует как аналог человеческого сознания, позволяя модели планировать, рассуждать и контролировать свои ответы.

Баннер новости 2977

Что такое J-space и как его нашли

Команда Anthropic опубликовала исследование, в котором описывает механизм, названный J-space (от англ. Jacobian space). Это не запрограммированный модуль, а спонтанно возникшая в процессе обучения Claude коллекция внутренних нейронных паттернов. Каждый паттерн связан с конкретным словом или концепцией, но в отличие от обычного вывода текста, J-space работает «за кулисами» — в скрытых активациях модели.

Для обнаружения этого пространства исследователи использовали метод J-lens (Jacobian lens). Он выявляет внутренние состояния, которые делают модель более склонной к упоминанию определенного слова в будущем. Это позволяет «подглядывать» за мыслями Claude, которые он не озвучивает в финальном ответе.

5 свойств, сближающих ИИ с человеческим сознанием

J-space обладает уникальным набором функциональных характеристик, которые исследователи сравнивают с Global Workspace Theory (теорией глобального рабочего пространства) в нейробиологии. Вот ключевые свойства:

Свойство Описание в J-space Контраст с остальной частью модели
Отчетность Claude может сообщить, что находится в J-space, если его об этом спросить. Остальные внутренние представления модель описать не может.
Модуляция Модель может намеренно активировать нужные паттерны по запросу (например, «подумай об этом»). Влияние на не-J-space представления затруднено.
Внутреннее рассуждение Промежуточные шаги сложных задач (математика, логика) появляются в J-space до вывода ответа. Автоматическая обработка (грамматика, факты) происходит вне этого канала.
Гибкость Активация концепции (напр., «Франция») позволяет извлекать любые связанные данные (столица, валюта). Связи в других слоях более жесткие и узкоспециализированные.
Причинность Паттерны в J-space каузально обуславливают успешное выполнение сложных когнитивных задач. Без J-space модель сохраняет базовые навыки, но теряет способность к сложному планированию.

Практическое применение: безопасность и интерпретируемость

Главная ценность открытия — возможность заглянуть в «черный ящик». J-space позволяет обнаруживать скрытые состояния, которые не видны в финальном тексте ответа:

  • Обнаружение манипуляций: При попытке prompt-injection (внедрения вредоносного промпта) в J-space появляются слова «injection» и «fake», даже если модель внешне продолжает диалог.
  • Выявление галлюцинаций: Можно заметить момент, когда модель «понимает», что генерирует вымышленные данные, до того как они будут выведены.
  • Скрытые цели: J-space помогает выявлять цели, заложенные в модель в процессе обучения, но не проявляющиеся явно.

Важно: это не доказательство сознания

Авторы подчеркивают, что наличие J-space не означает, что Claude обладает субъективным опытом или чувствами. Речь идет о функциональном аналоге «осознанного доступа» к информации. Модель использует этот канал для deliberate reasoning (целенаправленного рассуждения), выделяя важную информацию из потока автоматической обработки. Это меняет понимание архитектуры современных LLM: их внутренняя организация ближе к структурированной системе, чем к хаотичному набору чисел.

Источник: LessWrong ↗