Суть эксперимента: проверка гипотезы Anthropic
Anthropic в своей работе "Verbalizable Representations Form a Global Workspace in Language Models" утверждала, что J-Space (пространство вербализуемых представлений) служит глобальным рабочим пространством, где модель хранит промежуточные шаги рассуждения. Это означало бы, что замена промежуточного факта (например, планеты) на контрфактический должна радикально изменить финальный ответ.
Автор исследования Мирелла Цайслер (Mirella Zeisler) протестировала эту гипотезу на открытых моделях Qwen3.6-27B и Gemma 3 27B-it, используя датасеты workspace-bench и аннотированный набор от Anthropic. Цель — понять, действительно ли модель «думает» в J-Space или же этот инструмент полезен лишь для анализа, а не для управления.
Ключевые метрики: разрыв с Claude
Главный показатель успеха интервенции — процент случаев, когда замена промежуточного звена приводила к смене ответа модели на первый (top-1) результат. На моделях семейства Claude Anthropic сообщала о показателе в 54–70%. На открытых моделях результаты оказались катастрофически низкими:
| Условие эксперимента | Модель | Датасет | Top-1 Flip Rate (смена ответа) |
|---|---|---|---|
| Qwen / Workspace | Qwen3.6-27B | workspace-bench | 6.3% |
| Qwen / Anthropic | Qwen3.6-27B | Anthropic bank | 9.1% |
| Gemma / Workspace | Gemma 3 27B-it | workspace-bench | 7.1% |
| Gemma / Anthropic | Gemma 3 27B-it | Anthropic bank | 11.1% |
Даже в лучшем случае (Gemma/Anthropic) лишь 3 из 27 вмешательств привели к смене ответа. Это доказывает, что интервенции в J-Space часто сдвигают вероятность в нужном направлении, но недостаточно сильны, чтобы переопределить финальный выбор модели.
Почему J-lens не работает как «руль»?
Гипотеза глобального рабочего пространства предполагает, что замена промежуточного шага (интермедиата) должна влиять на результат сильнее или как минимум так же, как прямая подстановка финального ответа. Однако данные показывают обратное:
- Доминирование Answer Swaps: В трех из четырех условий (Qwen/Workspace, Qwen/Anthropic, Gemma/Workspace) прямая подмена финального ответа на контрфактический оказала более сильное влияние на вероятность, чем замена промежуточного звена.
- Исключение Gemma/Anthropic: Единственное условие, где замена интермедиата превзошла замену ответа, все равно не смогла обеспечить стабильную смену top-1 ответа (лишь 3/27 случаев).
Это указывает на то, что J-lens в открытых моделях эффективнее для зондирования (понимания того, что находится в модели), а не для стайринга (управления выводами). Промежуточные переменные, вероятно, не являются жестко закрепленными узлами в вычислительном графе, как предполагалось для Claude.
Сравнение J-lens и R-lens
Исследование также протестировало R-lens (matched R-lens), который должен давать более чистые показания на ранних слоях. Результаты показали, что R-lens либо равен J-lens, либо превосходит его (особенно в условии Gemma/Workspace), что делает его более предпочтительным инструментом для интерпретируемости в открытых моделях.
Вывод
Результаты ставят под сомнение универсальность гипотезы глобального рабочего пространства. Если для Claude J-Space — это активная среда рассуждений, то для Qwen и Gemma он, скорее всего, представляет собой скорее «архив» ассоциаций, чем активный рабочий стол. Для разработчиков это значит: не стоит полагаться на J-lens для точного контроля логики рассуждений в открытых моделях.
Источник: LessWrong ↗
