Исследования21 сентября 2026 г., 07:17 МСК🤖 Auto

RBS-Attention: Ускорение LLM в 20 раз без потери точности

Исследователи представили RBS-Attention — метод разреженного префилла, ускоряющий обработку длинных контекстов (128K) в 20.65 раза на NVIDIA H100 с минимальной потерей качества.

Баннер новости 7915

Проблема «разбавления» в длинных контекстах

Инференс больших языковых моделей (LLM) с длинным контекстом (long-context) упирается в этап префилла (prefill), где плотное самовнимание (dense self-attention) обрабатывает весь промпт перед генерацией. Традиционные методы разреженного выбора блоков часто страдают от эффекта mean dilution (разбавления средним): если в блоке есть один критически важный токен, но много шумовых, усредненная оценка релевантности может скрыть этот токен, что приведет к потере информации.

Решение: двухветвевой выбор RBS-Attention

Авторы (Chuxu Song, Jiuqi Wei, Zhencan Peng) предлагают метод RBS-Attention (Radius-Bounded Sparse Prefill), который не требует дообучения модели. Алгоритм использует две комплементарные ветви для выбора блоков:

  • Centroid base branch: захватывает среднюю релевантность (стандартный подход).
  • Rescue branch: использует максимальный радиус ключ-блока и распределение, зависящее от промпта, слоя и головы, чтобы выявить блоки, которые рискуют быть пропущенными из-за «разбавления».

Маски от обеих ветвей порогово фильтруются независимо, а затем комбинируются. Это позволяет сохранить регулярное выполнение FlashAttention для основных блоков, добавляя «спасательные» блоки только там, где это необходимо.

Результаты на Qwen3-30B и Qwen3-32B

Эксперименты проводились на GPU NVIDIA H100. Метод демонстрирует колоссальный прирост скорости на модели Qwen3-30B-A3B-Instruct-2507-FP8 с контекстом 128K токенов. При этом качество генерации на модели Qwen3-32B остается практически на уровне плотного внимания.

Метрика Результат RBS-Attention Примечание
Ускорение standalone prefill-attention 20.65× На H100, контекст 128K
Ускорение prefill-attention в vLLM 11.92× Интеграция с популярным движком
Ускорение Time-to-First-Token (TTFT) 5.97× Ключевой метрик UX для чат-ботов
Точность RULER (Qwen3-32B) 88.65 Сравнение с плотным вниманием: 89.52

Почему это важно

Снижение задержки первого токена (TTFT) в 6 раз делает LLM с длинным контекстом значительно более отзывчивыми в реальных приложениях. При этом падение точности на бенчмарке RULER составляет менее 1% (88.65 против 89.52), что подтверждает эффективность подхода. Дополнительные оценки на LongBench-v2, InfiniteBench и Video-MME также показывают стабильные результаты, что делает RBS-Attention перспективным решением для развертывания тяжелых моделей в продакшене без переплаты за GPU-мощности.

Источник: arXiv cs.AI ↗