Суть открытия: размер и дообучение не важны
Аарян Мехта (Aaryan Mehta) провел эксперимент, используя метод Jacobian lens (линзу Якоби) для анализа скрытых состояний нейросетей. Цель — проверить гипотезу Anthropic о наличии «глобального рабочего пространства» (Global Workspace) в моделях меньшего масштаба. Результаты показали, что наличие этого механизма не зависит от количества параметров (от 124M до 1.7B) и не является результатом инструктажа (instruction-tuning). Ключевым фактором стало качество современного препроцессинга данных и архитектуры.
Методология и инструменты
Исследование опиралось на сравнение пяти моделей двух семейств: GPT-2 (2019) и Qwen3 (2025). Использовалась линза Якоби, которая точнее стандартного Logit Lens считывает информацию в средних слоях сети, где происходят сложные двухшаговые вычисления. Тестирование проводилось на 100 документах WikiText с фиксированными порогами успеха.
Ключевые метрики эффективности
Самый яркий показатель — способность изменять ответ модели путем вмешательства в промежуточные активации (causal swap). Модели Qwen3 стабильно демонстрируют этот эффект, в то время как GPT-2 — нет, несмотря на наличие информации в скрытых слоях.
| Метрика | GPT-2 124M | GPT-2 355M | Qwen3 0.6B | Qwen3 1.7B | Qwen3 1.7B-Base |
|---|---|---|---|---|---|
| Точность двухшаговых задач (Two-hop) | 8% | 17% | 9% | 31% | 41% |
| Читаемость в средних слоях (из верных) | 71% | 53% | 88% | 50% | 70% |
| Успешная смена ответа (Top-1) | 0% | 0% | 38% | 39% | 49% |
| Успешная смена ответа (Top-5) | 0% | 0% | 75% | 71% | 73% |
| Концентрация линзы (отношение к случаю) | 1.00x | 1.05x | 1.97x | 2.14x | 2.00x |
Парадокс «молчания» модели
Второй важный вывод: ни одна из моделей, даже самых продвинутых, не может вербально сообщить о содержании своего рабочего пространства. Даже когда исследователь может прочитать данные из активаций и управлять ответом модели, сама нейросеть не «знает», что происходит в этих слоях. Доступ к информации (verbal report) появляется позже, чем само вычисление, что указывает на функциональную, а не сознательную природу этого механизма.
Почему это важно
Результаты подтверждают, что «глобальное рабочее пространство» — это свойство современной архитектуры и препроцессинга, а не результат RLHF или накопления параметров. GPT-2 служит идеальным негативным контролем, доказывая, что методика не дает ложноположительных срабатываний. Это открывает путь к более эффективному анализу интерпретируемости малых моделей, требующих меньше вычислительных ресурсов.
Источник: LessWrong ↗
