Суть эксперимента: 21 модель, 60M параметров
Автор исследовал редкое (sparse) самовнимание, где каждый запрос обращается к плотному локальному окну плюс набор смещений, распределенных по числам Фибоначчи. Ключевой параметр — скаляр alpha на каждом слое, который сжимает или расширяет эти смещения. Эксперимент проводился на 21 модели с одинаковым рецептом обучения: 60 миллионов параметров, 512 скрытых единиц, 16 слоев, 426 миллионов токенов.
Сравнивались четыре стратегии настройки alpha по глубине сети: фиксированное значение, обучаемое на каждом слое, статическое линейное расслоение и статическое копростое (anti-gridding) переназначение. Также использовалась контрольная группа с плотным вниманием (dense baseline).
Ключевые метрики и результаты
Результаты выявили три важных факта. Во-первых, статическое расслоение улучшает перплексность (perplexity) по сравнению как с фиксированным, так и с обучаемым alpha. Во-вторых, обучение параметров на каждом слое оказалось «инертным»: оно не превосходит статическое расписание, но увеличивает задержку инференса примерно в 5 раз. В-третьих, самое важное — все варианты редкого внимания успешно экстраполируют на длину, в 4 раза превышающую обучающую, тогда как плотное внимание коллапсирует.
| Метрика / Характеристика | Плотное внимание (Baseline) | Лучшее редкое внимание (Static Fibonacci) |
|---|---|---|
| Перплексность на длине обучения | Базовый уровень (лучший) | На ~26% выше (хуже) |
| Перплексность при 4x длине контекста | Рост на 201% (коллапс) | Минимальная деградация (успешная экстраполяция) |
| Задержка инференса (Latency) | Базовый уровень | Сравнимо с базой (в 5 раз быстрее обучаемого sparse) |
| Эффект расслоения | N/A | Равномерно по всем позициям контекста |
Почему это важно для индустрии
Проблема экстраполяции длины контекста (NTK-scaling, RoPE и др.) остается одной из самых сложных в LLM. Плотное внимание ограничено $O(N^2)$ и часто теряет способность обобщать за пределами длины, на которой обучалось. Данный метод показывает, что простая, не обучаемая структура внимания (статическое расписание) может обеспечить робастность к длинным контекстам без затрат на дообучение параметров alpha.
Хотя редкое внимание проигрывает плотному в точности на обучающей длине (26% хуже перплексности), его способность работать на 4x длине контекста делает его перспективным для задач, где важна дальняя зависимость, а не максимальная точность на коротких промптах. Это шаг к более эффективным архитектурам, не требующим огромных вычислительных ресурсов для инференса на длинных последовательностях.
Источник: arXiv cs.CL ↗
