Проблема «глубинного хранения» в трансформерах
Стандартные нерекуррентные трансформеры сталкиваются с фундаментальным ограничением: фактические знания, извлеченные на ранних слоях, становятся недоступными на этапе генерации ответа во втором «хопе» (шаге рассуждения). Это явление авторы называют depth-local storage problem. Хотя ранее предложенные Looped Transformers частично решали эту проблему за счет повторного использования памяти, они все еще демонстрировали неполную обобщающую способность.
Диагноз: разрыв представлений
Команда исследователей (Hengyu Fu, Stuart Russell, Song Mei и др.) выявила, что основной瓶颈 (бутылочное горлышко) носит репрезентативный характер. В задачах двухшагового рассуждения первый цикл часто делает «мостовое» сущность (bridge entity) почти идеально декодируемой, однако соответствующее скрытое состояние остается плохо согласованным с эмбеддингом токена. Удивительно, но простое вмешательство без дообучения (training-free realignment) почти полностью закрывает этот разрыв в обобщении.
Решение: DiscoLoop
На основе этого инсайта предложена архитектура DiscoLoop. Ее ключевая особенность — рекуррентный канал, несущий одновременно два типа данных:
- Дискретный канал эмбеддингов (Discrete Embeddings): сохраняет четкость символьных представлений.
- Непрерывный канал скрытых состояний (Continuous Hidden States): обеспечивает плавность вычислений.
Результаты и метрики
DiscoLoop демонстрирует точность, близкую к идеальной, при значительно меньшем количестве шагов обучения по сравнению с базовыми моделями. Архитектура показала эффективность как на синтетических языках, так и в реальных задачах предобучения, где она достигла более низкой функции потерь (training loss) и лучших результатов на бенчмарках.
| Характеристика | Looped Transformer (Baseline) | DiscoLoop (Предлагаемая модель) |
|---|---|---|
| Тип данных в рекурсии | Только непрерывные скрытые состояния | Дискретные эмбеддинги + Непрерывные состояния |
| Решение проблемы хранения | Частичное (неполное обобщение) | Полное (закрытие разрыва представлений) |
| Точность (Two-hop reasoning) | Ниже идеала | Почти идеальная (near-perfect) |
| Эффективность обучения | Требует больше шагов | Значительно меньше шагов |
Значение для индустрии
Применение DiscoLoop к реальному предобучению показывает, что смешанный дизайн каналов не только улучшает теоретические бенчмарки, но и трансформируется в практическое улучшение языкового моделирования. Это открывает путь к созданию более эффективных моделей, способных к сложному логическому выводу внутри одного прямого прохода (single forward pass), без необходимости в явном Chain-of-Thought.
Источник: arXiv cs.CL ↗
