Исследования16 июля 2026 г., 01:16 МСК🤖 Auto

Глобальное рабочее пространство есть даже в малых моделях: разбор данных

Исследование опровергает миф о том, что «внутреннее сознание» LLM зависит от размера или инструктажа. Модели Qwen3 демонстрируют признаки глобального рабочего пространства уже на уровне 1.7B параметров.

Баннер новости 3674

Суть открытия: размер и дообучение не важны

Аарян Мехта (Aaryan Mehta) провел эксперимент, используя метод Jacobian lens (линзу Якоби) для анализа скрытых состояний нейросетей. Цель — проверить гипотезу Anthropic о наличии «глобального рабочего пространства» (Global Workspace) в моделях меньшего масштаба. Результаты показали, что наличие этого механизма не зависит от количества параметров (от 124M до 1.7B) и не является результатом инструктажа (instruction-tuning). Ключевым фактором стало качество современного препроцессинга данных и архитектуры.

Методология и инструменты

Исследование опиралось на сравнение пяти моделей двух семейств: GPT-2 (2019) и Qwen3 (2025). Использовалась линза Якоби, которая точнее стандартного Logit Lens считывает информацию в средних слоях сети, где происходят сложные двухшаговые вычисления. Тестирование проводилось на 100 документах WikiText с фиксированными порогами успеха.

Ключевые метрики эффективности

Самый яркий показатель — способность изменять ответ модели путем вмешательства в промежуточные активации (causal swap). Модели Qwen3 стабильно демонстрируют этот эффект, в то время как GPT-2 — нет, несмотря на наличие информации в скрытых слоях.

Метрика GPT-2 124M GPT-2 355M Qwen3 0.6B Qwen3 1.7B Qwen3 1.7B-Base
Точность двухшаговых задач (Two-hop) 8% 17% 9% 31% 41%
Читаемость в средних слоях (из верных) 71% 53% 88% 50% 70%
Успешная смена ответа (Top-1) 0% 0% 38% 39% 49%
Успешная смена ответа (Top-5) 0% 0% 75% 71% 73%
Концентрация линзы (отношение к случаю) 1.00x 1.05x 1.97x 2.14x 2.00x

Парадокс «молчания» модели

Второй важный вывод: ни одна из моделей, даже самых продвинутых, не может вербально сообщить о содержании своего рабочего пространства. Даже когда исследователь может прочитать данные из активаций и управлять ответом модели, сама нейросеть не «знает», что происходит в этих слоях. Доступ к информации (verbal report) появляется позже, чем само вычисление, что указывает на функциональную, а не сознательную природу этого механизма.

Почему это важно

Результаты подтверждают, что «глобальное рабочее пространство» — это свойство современной архитектуры и препроцессинга, а не результат RLHF или накопления параметров. GPT-2 служит идеальным негативным контролем, доказывая, что методика не дает ложноположительных срабатываний. Это открывает путь к более эффективному анализу интерпретируемости малых моделей, требующих меньше вычислительных ресурсов.

Источник: LessWrong ↗