Исследования30 июня 2026 г., 17:18 МСК🤖 Auto

Fibonacci-attention: Статические расписания бьют обучаемые и работают на 4x длине контекста

Исследование Chad A. Capps показывает, что статическое распределение внимания по схеме Фибоначчи превосходит обучаемые методы и позволяет моделям экстраполировать контекст в 4 раза длиннее обучающего, где плотное внимание проваливается.

Баннер новости 2577

Суть эксперимента: 21 модель, 60M параметров

Автор исследовал редкое (sparse) самовнимание, где каждый запрос обращается к плотному локальному окну плюс набор смещений, распределенных по числам Фибоначчи. Ключевой параметр — скаляр alpha на каждом слое, который сжимает или расширяет эти смещения. Эксперимент проводился на 21 модели с одинаковым рецептом обучения: 60 миллионов параметров, 512 скрытых единиц, 16 слоев, 426 миллионов токенов.

Сравнивались четыре стратегии настройки alpha по глубине сети: фиксированное значение, обучаемое на каждом слое, статическое линейное расслоение и статическое копростое (anti-gridding) переназначение. Также использовалась контрольная группа с плотным вниманием (dense baseline).

Ключевые метрики и результаты

Результаты выявили три важных факта. Во-первых, статическое расслоение улучшает перплексность (perplexity) по сравнению как с фиксированным, так и с обучаемым alpha. Во-вторых, обучение параметров на каждом слое оказалось «инертным»: оно не превосходит статическое расписание, но увеличивает задержку инференса примерно в 5 раз. В-третьих, самое важное — все варианты редкого внимания успешно экстраполируют на длину, в 4 раза превышающую обучающую, тогда как плотное внимание коллапсирует.

Метрика / Характеристика Плотное внимание (Baseline) Лучшее редкое внимание (Static Fibonacci)
Перплексность на длине обучения Базовый уровень (лучший) На ~26% выше (хуже)
Перплексность при 4x длине контекста Рост на 201% (коллапс) Минимальная деградация (успешная экстраполяция)
Задержка инференса (Latency) Базовый уровень Сравнимо с базой (в 5 раз быстрее обучаемого sparse)
Эффект расслоения N/A Равномерно по всем позициям контекста

Почему это важно для индустрии

Проблема экстраполяции длины контекста (NTK-scaling, RoPE и др.) остается одной из самых сложных в LLM. Плотное внимание ограничено $O(N^2)$ и часто теряет способность обобщать за пределами длины, на которой обучалось. Данный метод показывает, что простая, не обучаемая структура внимания (статическое расписание) может обеспечить робастность к длинным контекстам без затрат на дообучение параметров alpha.

Хотя редкое внимание проигрывает плотному в точности на обучающей длине (26% хуже перплексности), его способность работать на 4x длине контекста делает его перспективным для задач, где важна дальняя зависимость, а не максимальная точность на коротких промптах. Это шаг к более эффективным архитектурам, не требующим огромных вычислительных ресурсов для инференса на длинных последовательностях.

Источник: arXiv cs.CL ↗