Исследования30 июля 2026 г., 07:16 МСК🤖 Auto

GLIDE: Адаптивный гибрид внимания для ускорения LLM

Исследователи представили GLIDE — метод, который динамически смешивает softmax и линейное внимание по слоям, сокращая задержку генерации без потери качества.

Баннер новости 4691

Проблема: узкое место KV-кэша

При масштабировании больших языковых моделей (LLM) на длинные контексты (long-context) основным bottleneck во время декодирования становится ввод-вывод памяти (memory I/O) и вычислительные накладные расходы на хранение Key-Value (KV) кэша. Традиционные подходы пытаются оптимизировать это глобально, но часто жертвуют качеством модели.

Решение: GLIDE (Guided Layerwise Hybrid Attention)

Авторы (Vimal William, Ravi Tandon, Jyotikrishna Dass) предлагают GLIDE — механизм, который использует гетерогенность слоев нейросети. Идея проста: ранние слои чувствительны к удалению softmax-внимания, тогда как глубокие слои обладают избыточностью и легко переносят замену на линейную рекуррентную агрегацию. GLIDE адаптирует этот баланс для каждого слоя индивидуально, сжимая footprint softmax-внимания неравномерно.

Как это работает

В отличие от uniform-гибридных подходов, GLDE внедряет:

  • Sliding-window softmax attention в чувствительных слоях для сохранения точности.
  • Linear recurrent aggregation в глубоких слоях для радикального снижения объема передаваемых данных.

Это позволяет сократить aggregate KV cache I/O, сохраняя экспрессивную мощность модели там, где это критически важно.

Результаты и значимость

Эмпирические оценки показывают, что GLIDE достигает превосходного компромисса между производительностью и эффективностью. Ключевое достижение — снижение end-to-end latency (сквозной задержки) при генерации длинных контекстов без компромиссов в качестве вывода (quality). Это открывает путь к более быстрому инференсу LLM на ресурсоемких задачах.

Компонент Роль в GLIDE Преимущество
Softmax Attention Используется в ранних слоях Сохраняет высокую чувствительность к контексту
Linear Recurrence Используется в глубоких слоях Агрессивное сжатие KV-кэша, снижение I/O
Layer-wise Adaptive Динамический баланс Оптимизация под гетерогенность архитектуры

Работа опубликована 26 июня 2026 года в arXiv (cs.AI).

Источник: arXiv cs.AI ↗