Исследования30 сентября 2026 г., 12:16 МСК🤖 Auto

SMat-Attention: Новый подход к длинному контексту с VC-размерностью

Исследователи представили SMat-Attention, механизм, использующий VC-размерность для балансировки между точностью softmax-внимания и скоростью линейных моделей.

Баннер новости 8588

Проблема компромисса в длинном контексте

Современные модели последовательностей сталкиваются с фундаментальной дилеммой: стандартное softmax-внимание обеспечивает гибкое взаимодействие на уровне токенов, но требует квадратичных вычислительных затрат, тогда как линейное внимание предлагает линейное время обучения и постоянное время декодирования, сжимая историю в состояние фиксированного размера. Авторы работы, опубликованной в arXiv (28 сентября 2026 года), предлагают решение через настраиваемую структуру маршрутизации.

Суть метода: VC-размерность как регулятор

Предложенный метод Structured Matrix Attention (SMat-Attention) использует семейство причинных масок с структурированной долгосрочной маршрутизацией. Ключевым параметром здесь выступает VC-размерность ($d$) строк поддержки маски:

  • $d=1$: Восстанавливает стандартную причинную маску.
  • Увеличение $d$: Позволяет создавать более сложные паттерны маршрутизации подмножеств, увеличивая выразительность модели.

Вычислительная эффективность и метрики

Для обеспечения эффективности на аппаратном уровне разработаны алгоритмы прямого и обратного прохода по чанкам. Несмотря на то, что маска остается плотной, вычислительная сложность для последовательности длины $T$ составляет:

Параметр Сложность / Характеристика
Работа (Prefill) $O(T^{2-3/d} + T)$
Кэшированные состояния (Streaming) $O(T^{1-1/d})$
Время декодирования Постоянное на токен (после дальнего префикса)

Таким образом, VC-размерность становится явным «рычагом», управляющим сложностью доступа, стоимостью префилла и памятью декодирования.

Интеграция с Mamba-2 и Gated DeltaNet

Исследование также демонстрирует расширение SMat-Attention на архитектуры Mamba-2 и Gated DeltaNet. Использование обучаемой маршрутизации с чтением top-$k$ запросов позволяет:

  • Сохранить субквадратичную стоимость префилла.
  • Улучшить точность извлечения (recall) по сравнению с базовыми моделями в ряде сценариев.
  • Достичь сопоставимых результатов в задачах языкового моделирования на небольших наборах данных.

Значение для индустрии

Работа открывает путь к созданию моделей, которые не жертвуют точностью обработки длинного контекста ради скорости, предлагая новый математический аппарат для контроля над архитектурными компромиссами в больших языковых моделях.

Источник: arXiv cs.AI ↗