Релиз модели23 июля 2026 г., 10:17 МСК🤖 Auto

LISA: ускорение LLM на 50% без переобучения

Исследователи представили LISA — модуль внимания, снижающий сложность вывода с O(n²) до O(nM). Решение дает прирост точности на 5.6% и удваивает скорость работы моделей с длинным контекстом.

Баннер новости 4187

Проблема длинного контекста

Развитие моделей с длинным цепочечным мышлением (Long Chain-of-Thought), таких как DeepSeek-R1, привело к резкому росту длины контекста во время инференса. Стандартный механизм Self-Attention имеет вычислительную сложность O(n²), что делает обработку длинных последовательностей экономически нецелесообразной для продакшена. LISA (Linear-Indexed Sparse Attention) предлагает решение, не требующее переобучения модели с нуля.

Архитектура LISA

Модуль работает по принципу «plug-and-play» и интегрируется параллельно в существующую архитектуру. Он объединяет два компонента:

  • Linear Attention: обеспечивает долгосрочную память с линейной сложностью O(n).
  • Lightning Indexer: динамически выбирает топ-M наиболее важных токенов из полного контекста для Sparse Self-Attention.

Результирующая сложность генерации n токенов снижается до O(nM), где M значительно меньше n. Ветви объединяются через механизм гейтирования (gating mechanism).

Двухэтапное обучение

Процесс оптимизации разделен на два этапа для сохранения знаний исходной модели:

  1. Этап 1: Инициализация линейного внимания для захвата долгосрочных зависимостей. Скользящее окно (sliding-window) оптимизируется через дистилляцию знаний, чтобы аппроксимировать распределение внимания замороженной модели-учителя.
  2. Этап 2: Внедрение Indexer для замены статичного скользящего окна. Индексатор обучается с использованием новой функции потерь KL-divergence per-head, выравнивающей его выбор токенов с паттернами внимания учителя.

Результаты и метрики

Эксперименты проводились на моделях, дистиллированных из DeepSeek (на базе Qwen). LISA демонстрирует значительное улучшение эффективности и качества:

Метрика Результат Детали
Скорость инференса +50% При контексте 16K токенов
Точность (AIME) +5.6% Средний прирост на бенчмарках
Точность (MATH-500) +5.6% Средний прирост на бенчмарках

Значение для индустрии

Работа авторов (Yu Zhao, Zekun Zhang и др.) решает критическую проблему масштабируемости LLM. Возможность внедрения LISA без полного переобучения позволяет быстро адаптировать существующие мощные модели под задачи с длинным контекстом, снижая затраты на вычисления и повышая качество рассуждений.

Источник: arXiv cs.AI ↗