Исследования3 сентября 2026 г., 10:17 МСК🤖 Auto

Рекуррентные трансформеры: работает ли «глобальное рабочее пространство»?

Исследование Wang и Reid показывает, что рекуррентные архитектуры (Looped/Recurrent Transformers) сохраняют функционал «глобального рабочего пространства», но кардинально меняют механизмы доступа к данным по сравнению с классическими feedforward моде

Баннер новости 6661

Суть эксперимента: проверка гипотезы через призму Якобиана

Недавние работы выявили в стандартных feedforward-трансформерах узкий слой представлений, функционирующий как аналог «глобального рабочего пространства» (Global Workspace) — зоны, где информация становится вербализуемой и каузально значимой. Авторы статьи Wenlong Wang и Fergal Reid поставили под сомнение, сохранится ли эта функциональность, если глубина сети реализуется не через стек уникальных слоев, а через рекуррентное повторение одних и тех же весов (recurrence).

Для решения этой проблемы исследователи применили метод Jacobian lens к итеративным архитектурам, используя виртуальный адаптер для разворачивания (unrolling) сети. Была применена полная suite тестов: lens fitting, readout и 11 семейств каузальных экспериментов.

Архитектуры и метрики

В качестве тестовых полигонов выступили две рекуррентные модели, сравниваемые с базовой линейкой Qwen3.6-27B. Ключевые параметры моделей приведены ниже:

Модель Архитектура Параметры Особенности обучения
Ouro-2.6B Looped Transformer 2.6B 48 слоев, зацикленных 4 раза; глубокий надзор (deeply supervised)
Huginn-0125 Depth-Recurrent 0.125B 4 слоя ядра, повторенные 16 раз; обучение латентному рассуждению
Qwen3.6-27B Standard Feedforward 27B 64 слоя с развязанными весами (untied layers); базовая линия

Ключевые находки: два разных типа памяти

Исследование подтвердило, что «рабочее пространство» формируется в итеративной части обеих архитектур, однако механизмы доступа к нему радикально различаются:

  • Ouro (Looped): Содержимое рабочего пространства реконструируется на каждой итерации. Линейный транспорт не может перенести контент через границы циклов. Это означает, что операции записи (writes) и аблиации (ablations) должны охватывать каждый оставшийся цикл для сохранения эффекта.
  • Huginn (Recurrent): Содержимое переносится вперед через все 16 рекуррентных шагов. Однако операции чтения, записи и аблиации действуют только в пределах скользящего окна размером примерно в два рекуррентных шага.

Влияние супервизии на вербализацию

Авторы также выяснили, что способность к вербализации нового введенного контента напрямую зависит от наличия явного супервизора на каждой итерации. При этом способность управлять уже существующим контентом (steering) от явного супервизора не зависит. Эти результаты критически важны для проектирования эффективных рекуррентных LLM, требующих оптимизации вычислительных ресурсов без потери когнитивных функций модели.

Источник: arXiv cs.AI ↗