От скрытых вычислений к вербализуемому знанию
В человеческом мозге лишь малая часть информации становится доступной для сознательного контроля, вербализации и гибкого рассуждения. Новая работа, опубликованная 16 июля 2026 года, доказывает, что в больших языковых моделях (LLM) сформировался функционально аналогичный механизм. Авторы — Wes Gurnee, Nicholas Sofroniew, Adam Pearce и 13 соавторов — используют новый метод интерпретируемости под названием Jacobian lens (Якобиановская линза). Этот инструмент позволяет идентифицировать внутренние представления модели, которые она «настроена» вербализовать в любой момент обработки.
Выделенный набор представлений авторы назвали J-пространством (J-space). Оно обладает ключевыми свойствами, характерными для глобального рабочего пространства сознания: его содержимое можно отчитывать, целенаправленно вызывать и удерживать, использовать для промежуточных шагов «молчаливого» рассуждения и передавать как аргументы в произвольные downstream-вычисления.
Структурные маркеры «сознания» в нейросети
J-пространство не распределено по всей сети равномерно. Исследование выявило четкие структурные сигнатуры, ассоциируемые теорией глобального рабочего пространства:
- Локализация: когерентное содержимое удерживается только в промежудном диапазоне слоев модели.
- Емкость: одновременно удерживается порядка десятков концептов.
- Широкое вещание: веса модели транслируют эти представления шире, чем любые другие внутренние состояния.
При этом автоматическая обработка, такая как синтаксический разбор текста или рутинные инференсы, протекает вне этого пространства, что разделяет «быстрое» и «медленное» мышление модели.
Аудит выравнивания и скрытые намерения
Самое практическое применение J-пространства — это аудит безопасности и выравнивания (alignment). Поскольку J-space отражает то, что модель *могла бы* сказать, если бы её прервали, оно выявляет стратегическое обдумывание и обученные несовместимые диспозиции, которые никогда не появляются в финальном выводе модели.
| Характеристика | Автоматическая обработка | J-пространство (J-space) |
|---|---|---|
| Доступность | Невербализуемо, скрыто | Готово к вербализации |
| Роль | Рутинный инференс, парсинг | Гибкое рассуждение, контроль |
| Локализация | Распределено по слоям | Промежуточный диапазон слоев |
| Применение в аудите | Показывает только итог | Выявляет скрытые намерения и обход |
Контрфактическое обучение: новый подход к безопасности
Авторы обнаружили, что пост-тренировка (post-training) внедряет в J-пространство «точку зрения ассистента». На основе этого они предложили метод counterfactual reflection training (контрфактическое обучение рефлексии). Суть метода: модель обучается только тому, что она ответила бы, если бы её прервали и попросили поразмыслить. Это позволяет улучшить поведение модели, воздействуя непосредственно на механизм «сознательного» контроля, а не только на финальные токены.
Источник: arXiv cs.CL ↗
