Проблема длинного контекста
Развитие моделей с длинным цепочечным мышлением (Long Chain-of-Thought), таких как DeepSeek-R1, привело к резкому росту длины контекста во время инференса. Стандартный механизм Self-Attention имеет вычислительную сложность O(n²), что делает обработку длинных последовательностей экономически нецелесообразной для продакшена. LISA (Linear-Indexed Sparse Attention) предлагает решение, не требующее переобучения модели с нуля.
Архитектура LISA
Модуль работает по принципу «plug-and-play» и интегрируется параллельно в существующую архитектуру. Он объединяет два компонента:
- Linear Attention: обеспечивает долгосрочную память с линейной сложностью O(n).
- Lightning Indexer: динамически выбирает топ-M наиболее важных токенов из полного контекста для Sparse Self-Attention.
Результирующая сложность генерации n токенов снижается до O(nM), где M значительно меньше n. Ветви объединяются через механизм гейтирования (gating mechanism).
Двухэтапное обучение
Процесс оптимизации разделен на два этапа для сохранения знаний исходной модели:
- Этап 1: Инициализация линейного внимания для захвата долгосрочных зависимостей. Скользящее окно (sliding-window) оптимизируется через дистилляцию знаний, чтобы аппроксимировать распределение внимания замороженной модели-учителя.
- Этап 2: Внедрение Indexer для замены статичного скользящего окна. Индексатор обучается с использованием новой функции потерь KL-divergence per-head, выравнивающей его выбор токенов с паттернами внимания учителя.
Результаты и метрики
Эксперименты проводились на моделях, дистиллированных из DeepSeek (на базе Qwen). LISA демонстрирует значительное улучшение эффективности и качества:
| Метрика | Результат | Детали |
|---|---|---|
| Скорость инференса | +50% | При контексте 16K токенов |
| Точность (AIME) | +5.6% | Средний прирост на бенчмарках |
| Точность (MATH-500) | +5.6% | Средний прирост на бенчмарках |
Значение для индустрии
Работа авторов (Yu Zhao, Zekun Zhang и др.) решает критическую проблему масштабируемости LLM. Возможность внедрения LISA без полного переобучения позволяет быстро адаптировать существующие мощные модели под задачи с длинным контекстом, снижая затраты на вычисления и повышая качество рассуждений.
Источник: arXiv cs.AI ↗
