Исследования28 сентября 2026 г., 08:19 МСК🤖 Auto

J-Space не глобальное рабочее пространство: провал репликации на Qwen и Gemma

Исследование показало, что гипотеза Anthropic о J-Space как о «рабочей памяти» моделей не подтверждается на открытых весах. Интервенции в промежуточные шаги редко меняют ответ модели, уступая прямому подстановочному ответу.

Баннер новости 8398

Суть эксперимента: проверка гипотезы Anthropic

Anthropic в своей работе "Verbalizable Representations Form a Global Workspace in Language Models" утверждала, что J-Space (пространство вербализуемых представлений) служит глобальным рабочим пространством, где модель хранит промежуточные шаги рассуждения. Это означало бы, что замена промежуточного факта (например, планеты) на контрфактический должна радикально изменить финальный ответ.

Автор исследования Мирелла Цайслер (Mirella Zeisler) протестировала эту гипотезу на открытых моделях Qwen3.6-27B и Gemma 3 27B-it, используя датасеты workspace-bench и аннотированный набор от Anthropic. Цель — понять, действительно ли модель «думает» в J-Space или же этот инструмент полезен лишь для анализа, а не для управления.

Ключевые метрики: разрыв с Claude

Главный показатель успеха интервенции — процент случаев, когда замена промежуточного звена приводила к смене ответа модели на первый (top-1) результат. На моделях семейства Claude Anthropic сообщала о показателе в 54–70%. На открытых моделях результаты оказались катастрофически низкими:

Условие эксперимента Модель Датасет Top-1 Flip Rate (смена ответа)
Qwen / Workspace Qwen3.6-27B workspace-bench 6.3%
Qwen / Anthropic Qwen3.6-27B Anthropic bank 9.1%
Gemma / Workspace Gemma 3 27B-it workspace-bench 7.1%
Gemma / Anthropic Gemma 3 27B-it Anthropic bank 11.1%

Даже в лучшем случае (Gemma/Anthropic) лишь 3 из 27 вмешательств привели к смене ответа. Это доказывает, что интервенции в J-Space часто сдвигают вероятность в нужном направлении, но недостаточно сильны, чтобы переопределить финальный выбор модели.

Почему J-lens не работает как «руль»?

Гипотеза глобального рабочего пространства предполагает, что замена промежуточного шага (интермедиата) должна влиять на результат сильнее или как минимум так же, как прямая подстановка финального ответа. Однако данные показывают обратное:

  • Доминирование Answer Swaps: В трех из четырех условий (Qwen/Workspace, Qwen/Anthropic, Gemma/Workspace) прямая подмена финального ответа на контрфактический оказала более сильное влияние на вероятность, чем замена промежуточного звена.
  • Исключение Gemma/Anthropic: Единственное условие, где замена интермедиата превзошла замену ответа, все равно не смогла обеспечить стабильную смену top-1 ответа (лишь 3/27 случаев).

Это указывает на то, что J-lens в открытых моделях эффективнее для зондирования (понимания того, что находится в модели), а не для стайринга (управления выводами). Промежуточные переменные, вероятно, не являются жестко закрепленными узлами в вычислительном графе, как предполагалось для Claude.

Сравнение J-lens и R-lens

Исследование также протестировало R-lens (matched R-lens), который должен давать более чистые показания на ранних слоях. Результаты показали, что R-lens либо равен J-lens, либо превосходит его (особенно в условии Gemma/Workspace), что делает его более предпочтительным инструментом для интерпретируемости в открытых моделях.

Вывод

Результаты ставят под сомнение универсальность гипотезы глобального рабочего пространства. Если для Claude J-Space — это активная среда рассуждений, то для Qwen и Gemma он, скорее всего, представляет собой скорее «архив» ассоциаций, чем активный рабочий стол. Для разработчиков это значит: не стоит полагаться на J-lens для точного контроля логики рассуждений в открытых моделях.

Источник: LessWrong ↗