Проблема компромисса в длинном контексте
Современные модели последовательностей сталкиваются с фундаментальной дилеммой: стандартное softmax-внимание обеспечивает гибкое взаимодействие на уровне токенов, но требует квадратичных вычислительных затрат, тогда как линейное внимание предлагает линейное время обучения и постоянное время декодирования, сжимая историю в состояние фиксированного размера. Авторы работы, опубликованной в arXiv (28 сентября 2026 года), предлагают решение через настраиваемую структуру маршрутизации.
Суть метода: VC-размерность как регулятор
Предложенный метод Structured Matrix Attention (SMat-Attention) использует семейство причинных масок с структурированной долгосрочной маршрутизацией. Ключевым параметром здесь выступает VC-размерность ($d$) строк поддержки маски:
- $d=1$: Восстанавливает стандартную причинную маску.
- Увеличение $d$: Позволяет создавать более сложные паттерны маршрутизации подмножеств, увеличивая выразительность модели.
Вычислительная эффективность и метрики
Для обеспечения эффективности на аппаратном уровне разработаны алгоритмы прямого и обратного прохода по чанкам. Несмотря на то, что маска остается плотной, вычислительная сложность для последовательности длины $T$ составляет:
| Параметр | Сложность / Характеристика |
|---|---|
| Работа (Prefill) | $O(T^{2-3/d} + T)$ |
| Кэшированные состояния (Streaming) | $O(T^{1-1/d})$ |
| Время декодирования | Постоянное на токен (после дальнего префикса) |
Таким образом, VC-размерность становится явным «рычагом», управляющим сложностью доступа, стоимостью префилла и памятью декодирования.
Интеграция с Mamba-2 и Gated DeltaNet
Исследование также демонстрирует расширение SMat-Attention на архитектуры Mamba-2 и Gated DeltaNet. Использование обучаемой маршрутизации с чтением top-$k$ запросов позволяет:
- Сохранить субквадратичную стоимость префилла.
- Улучшить точность извлечения (recall) по сравнению с базовыми моделями в ряде сценариев.
- Достичь сопоставимых результатов в задачах языкового моделирования на небольших наборах данных.
Значение для индустрии
Работа открывает путь к созданию моделей, которые не жертвуют точностью обработки длинного контекста ради скорости, предлагая новый математический аппарат для контроля над архитектурными компромиссами в больших языковых моделях.
Источник: arXiv cs.AI ↗
