Суть эксперимента: проверка гипотезы через призму Якобиана
Недавние работы выявили в стандартных feedforward-трансформерах узкий слой представлений, функционирующий как аналог «глобального рабочего пространства» (Global Workspace) — зоны, где информация становится вербализуемой и каузально значимой. Авторы статьи Wenlong Wang и Fergal Reid поставили под сомнение, сохранится ли эта функциональность, если глубина сети реализуется не через стек уникальных слоев, а через рекуррентное повторение одних и тех же весов (recurrence).
Для решения этой проблемы исследователи применили метод Jacobian lens к итеративным архитектурам, используя виртуальный адаптер для разворачивания (unrolling) сети. Была применена полная suite тестов: lens fitting, readout и 11 семейств каузальных экспериментов.
Архитектуры и метрики
В качестве тестовых полигонов выступили две рекуррентные модели, сравниваемые с базовой линейкой Qwen3.6-27B. Ключевые параметры моделей приведены ниже:
| Модель | Архитектура | Параметры | Особенности обучения |
|---|---|---|---|
| Ouro-2.6B | Looped Transformer | 2.6B | 48 слоев, зацикленных 4 раза; глубокий надзор (deeply supervised) |
| Huginn-0125 | Depth-Recurrent | 0.125B | 4 слоя ядра, повторенные 16 раз; обучение латентному рассуждению |
| Qwen3.6-27B | Standard Feedforward | 27B | 64 слоя с развязанными весами (untied layers); базовая линия |
Ключевые находки: два разных типа памяти
Исследование подтвердило, что «рабочее пространство» формируется в итеративной части обеих архитектур, однако механизмы доступа к нему радикально различаются:
- Ouro (Looped): Содержимое рабочего пространства реконструируется на каждой итерации. Линейный транспорт не может перенести контент через границы циклов. Это означает, что операции записи (writes) и аблиации (ablations) должны охватывать каждый оставшийся цикл для сохранения эффекта.
- Huginn (Recurrent): Содержимое переносится вперед через все 16 рекуррентных шагов. Однако операции чтения, записи и аблиации действуют только в пределах скользящего окна размером примерно в два рекуррентных шага.
Влияние супервизии на вербализацию
Авторы также выяснили, что способность к вербализации нового введенного контента напрямую зависит от наличия явного супервизора на каждой итерации. При этом способность управлять уже существующим контентом (steering) от явного супервизора не зависит. Эти результаты критически важны для проектирования эффективных рекуррентных LLM, требующих оптимизации вычислительных ресурсов без потери когнитивных функций модели.
Источник: arXiv cs.AI ↗
