Проблема плоских последовательностей
Существующие методы сжатия промптов (prompt compression) часто рассматривают текст как плоскую последовательность токенов. Это упускает из виду распределенную природу важной информации, которая может быть разбросана по разным частям текста и связана как локальными синтаксическими зависимостями, так и глобальными семантическими отношениями. Авторы работы, опубликованной в arXiv (2026), предлагают новый подход: представление текста в виде графа, где токены или предложения становятся узлами, а их зависимости — ребрами.
Методология: RAGP и Леви-блуждания
Предложенный метод RAGP (Redundancy-Aware Graph Pruning) формулирует сжатие как задачу отсечения избыточности на мультиплексном графе. Этот граф объединяет два типа связей:
- Локальные зависимости: основанные на механизме внимания (attention-based), обеспечивающие детальный анализ.
- Глобальные отношения: семантические связи более высокого уровня.
Для эффективного выявления нерелевантных узлов в такой гетерогенной структуре (с плотными локальными подграфами и разреженными глобальными связями) авторы используют случайные блуждания Леви (Lévy walks). Тяжелохвостное распределение шагов Леви позволяет алгоритму естественным образом балансировать между локальным исследованием (exploitation) и глобальным поиском (exploration), что критически важно для сохранения ключевых смысловых блоков.
Результаты на LongBench
Эксперименты проводились на бенчмарке LongBench. RAGP демонстрирует превосходство над существующими методами, основанными на LLM, и даже над передовыми визуальными парадигмами сжатия текста. Ключевая метрика — сохранение качества ответа при значительном сокращении входных данных.
| Метод | Коэффициент сжатия | Средний балл (LongBench) |
|---|---|---|
| RAGP (предлагаемый) | 4x | 49.3 |
| LongLLMLingua | 3x | 48.8 |
Обратите внимание: RAGP достигает более высокого результата (49.3 против 48.8) при более агрессивном сжатии (4x против 3x). Это указывает на то, что графовый подход лучше сохраняет информативность текста, позволяя сократить объем входных данных сильнее без потери качества ответов модели.
Значение для индустрии
Эффективное сжатие промптов напрямую влияет на стоимость инференса и скорость работы LLM, особенно в задачах RAG (Retrieval-Augmented Generation), где контекстное окно быстро переполняется. Переход от линейных методов отсечения токенов к графовому анализу с использованием стохастических алгоритмов поиска (как Леви-блуждания) открывает путь к созданию более «умных» систем фильтрации контекста, которые понимают структуру документа, а не просто статистику токенов. Код метода доступен для воспроизведения.
Источник: arXiv cs.CL ↗
