Исследования23 июля 2026 г., 14:18 МСК🤖 Auto

Spectral-LSH: Сжатие промптов без обучения с субквадратичной сложностью

Исследователи представили Spectral-LSH — метод сжатия длинных промптов, который снижает вычислительные затраты на префиллинг, избегая квадратичной сложности внимания.

Баннер новости 4205

Проблема квадратичной сложности

Инференс с длинными контекстами остается узким местом из-за того, что операция внимания (attention) масштабируется как $O(N^2)$ относительно длины последовательности. Это делает обработку больших документов или кодовых баз крайне дорогой. Авторы предлагают решение — Spectral-LSH, метод сжатия промптов, не требующий дообучения модели (training-free), который работает на этапе префиллинга, до того как текст попадет в языковую модель.

Техническая суть: от ядра внимания к макротокенам

Метод использует подпространства Крылова и случайные признаки для аппроксимации доминирующих компонент неявного оператора ядра внимания. Это позволяет избежать явного вычисления матрицы внимания размером $N \times N$. Затем применяется алгоритм SimHash в пространстве собственных векторов внимания, чтобы сгруппировать похожие токены и агрегировать их в «макротокены» с сохранением каузальной позиционной информации.

Результаты на моделях Mistral и Qwen

Эксперименты проводились на моделях Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct и Qwen2.5-14B-Instruct на датасете C4. Ключевым открытием стал фазовый переход качества в зависимости от коэффициента сжатия ($\rho$). Ниже порога $4\times$ обычное чанкование (chunking) эффективнее по соотношению задержка/качество. Однако при сжатии выше $8\times$ спектральный путь Spectral-LSH сохраняет качество, которое теряется при простом чанковании.

Модель Режим Коэф. сжатия Исходный PPL PPL после сжатия
Qwen2.5-7B Adaptive 16× 353.409 196.963
Qwen2.5-14B Adaptive 16× 9.533 3.427

Адаптивный бэкенд и стресс-тесты

Авторы реализовали адаптивный бэкенд, который автоматически выбирает стратегию: использует чанкование при низком сжатии для максимальной скорости, и спектральное кластеризацию при высоком сжатии для сохранения точности. На структурированных данных (JSON, код, таблицы) локальный LSH улучшил все метрики по сравнению с чанкованием при коэффициенте $8\times$, хотя чанкование остается самым быстрым методом по общей латентности.

Источник: arXiv cs.AI ↗