Суть прорыва: закрытие рекуррентного цикла
В стандартных декодерных LLM вычисления на последнем слое токена t не влияют на первый слой токена t+1; коммуникация происходит только через механизм внимания (attention) к кэшированным ключам и значениям. Новая архитектура Recurrent Looped Transformer (RLT) от Яфаня Чжана (Princeton) предлагает закрыть этот цикл. Конечное скрытое состояние декодера и кэш внимания с скользящим окном (SWA) передаются в следующий токен без сброса на границе промпта и ответа.
Архитектурные детали и метрики
RLT сочетает причинный (causal) энкодер с рекуррентным декодером. Энкодер обрабатывает токены параллельно, создавая представления, из которых проецируется память. Декодер удерживает рекуррентное состояние. В эталонной конфигурации используется 48 слоев энкодера и 48 слоев декодера с общими весами. Это означает, что каждый токен проходит через 96 логических блоков, хотя вычислительная нагрузка на блок различается из-за кросс-внимания.
| Компонент | Характеристика / Механизм | Значение / Примечание |
|---|---|---|
| Структура | Причинный энкодер + Рекуррентный декодер | Параллельная обработка энкодера, последовательная рекурсия декодера |
| Состояние (State) | H = (s, C) | s — финальный вывод декодера, C — кэш SWA ключей/значений |
| Глубина пути | После t токенов | Путь состояния проходит через t·L блоков (48t в эталоне) |
| Логические блоки | На один токен | 96 блоков (48 энкодер + 48 декодер) |
| Механизм слияния | Gated merge | Объединяет представление энкодера e_t с предыдущим выводом s_{t-1} |
Три принципа дизайна
- Латентные рассуждения с неограниченной временной глубиной: После обработки t токенов путь состояния проходит через 48t блоков декодера. Работа на токен остается фиксированной, но структурная глубина растет линейно с длиной последовательности. Важно: автор предупреждает, что гейты и сжатие могут подавлять длинные пути, поэтому глубина не гарантирует качество рассуждений.
- Совместный дизайн модель-железо: Энкодер использует токено-параллельные ядра. Переходы декодера остаются последовательными внутри последовательности, но обновления от независимых последовательностей могут быть батчированы. Явно заявлено: никакого параллельного сканирования для нелинейного декодера не предполагается, и ускорения этапа prefill не обещается.
- Совместный дизайн модель-RL: Предобучение, SFT, сэмплирование и RL-реплей используют один переход состояния. Для RL алгоритм перестраивает память энкодера, рекуррентный вывод и кэш SWA с начала последовательности под текущими параметрами перед оценкой каждого действия. Старые состояния роуллаута не переиспользуются.
Обучение и обслуживание (Serving)
Предобучение использует полное предсказание следующего токена с полным обратным распространением через время (BPTT). При SFT маска потери применяется только к целям ассистента, но обновления состояния никогда не маскируются, позволяя градиентам от потерь ассистента распространяться через токены пользователя и инструментов. Для многошагового обслуживания требуется точный снимок префикса, включающий кэш энкодера, память, полное состояние декодера и метаданные позиций.
Важно: отсутствие измеренных результатов
На данный момент RLT является спецификацией архитектуры. Исследование явно сообщает об отсутствии измеренных результатов по эффективности, качеству рассуждений или масштабированию. Архитектура позиционируется как решение проблемы разрыва между prefill и decode этапами, но требует валидации на практике. Исследователь ссылается на предыдущие работы, такие как YOCO, DeepSeek-V4.1-Flash, Feedback Transformer и Universal Transformers, позиционируя RLT как эволюцию этих идей.
Источник: MarkTechPost ↗
