Проблема квадратичной сложности
Инференс с длинными контекстами остается узким местом из-за того, что операция внимания (attention) масштабируется как $O(N^2)$ относительно длины последовательности. Это делает обработку больших документов или кодовых баз крайне дорогой. Авторы предлагают решение — Spectral-LSH, метод сжатия промптов, не требующий дообучения модели (training-free), который работает на этапе префиллинга, до того как текст попадет в языковую модель.
Техническая суть: от ядра внимания к макротокенам
Метод использует подпространства Крылова и случайные признаки для аппроксимации доминирующих компонент неявного оператора ядра внимания. Это позволяет избежать явного вычисления матрицы внимания размером $N \times N$. Затем применяется алгоритм SimHash в пространстве собственных векторов внимания, чтобы сгруппировать похожие токены и агрегировать их в «макротокены» с сохранением каузальной позиционной информации.
Результаты на моделях Mistral и Qwen
Эксперименты проводились на моделях Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct и Qwen2.5-14B-Instruct на датасете C4. Ключевым открытием стал фазовый переход качества в зависимости от коэффициента сжатия ($\rho$). Ниже порога $4\times$ обычное чанкование (chunking) эффективнее по соотношению задержка/качество. Однако при сжатии выше $8\times$ спектральный путь Spectral-LSH сохраняет качество, которое теряется при простом чанковании.
| Модель | Режим | Коэф. сжатия | Исходный PPL | PPL после сжатия |
|---|---|---|---|---|
| Qwen2.5-7B | Adaptive | 16× | 353.409 | 196.963 |
| Qwen2.5-14B | Adaptive | 16× | 9.533 | 3.427 |
Адаптивный бэкенд и стресс-тесты
Авторы реализовали адаптивный бэкенд, который автоматически выбирает стратегию: использует чанкование при низком сжатии для максимальной скорости, и спектральное кластеризацию при высоком сжатии для сохранения точности. На структурированных данных (JSON, код, таблицы) локальный LSH улучшил все метрики по сравнению с чанкованием при коэффициенте $8\times$, хотя чанкование остается самым быстрым методом по общей латентности.
Источник: arXiv cs.AI ↗
