Проблема равномерной компрессии в RAG
Retrieval-Augmented Generation (RAG) улучшает языковые модели за счет извлечения доказательств, но обработка длинных фрагментов требует вычислительных ресурсов и может добавлять шум. Существующие методы мягкой компрессии (soft compression) кодируют фрагменты в компактные непрерывные эмбеддинги, но обычно назначают одинаковое количество токенов памяти каждому фрагменту, игнорируя его релевантность запросу. Это приводит к неэффективному использованию ограниченного бюджета памяти.
Решение: AdaMem
Авторы предлагают AdaMem — фреймворк, который использует оценки релевантности фрагментов для адаптивного распределения фиксированного бюджета токенов памяти. Общий компрессор, зависящий от запроса, одновременно генерирует непрерывные памяти фрагментов и их релевантность. Детерминированное правило выделяет больше токенов высоко-релевантным фрагментам и полностью исключает низко-релевантные.
Результаты бенчмарков
Метод протестирован на шести открыто-доменных QA-бенчмарках. AdaMem превосходит OSCAR (базовый метод с равномерным распределением) и другие подходы мягкой компрессии при сопоставимых бюджетах памяти. Ключевые метрики эффективности:
| Параметр | Результат AdaMem | Сравнение с базой (OSCAR) |
|---|---|---|
| Стандартная компрессия (16x) | Улучшение sub-string match | +3.2 балла (5.5%) Средний относительный прирост: 3.4% |
| Агрессивная компрессия (64x) | Улучшение sub-string match | Средний прирост: 14.6% Максимум на PopQA: +9.8 балла (19.7%) |
| Скорость инференса | Задержка (latency) | До 4x быстрее, чем полный контекст Сопоставима с равномерной компрессией |
Значение для индустрии
AdaMem демонстрирует, что релевантно-управляемое распределение памяти особенно эффективно при больших пулах извлечения и жестких ограничениях памяти. Метод сохраняет качество ответов на уровне несжатого контекста при задержке, в 4 раза меньшей, чем у полнотекстового инференса. Это открывает путь к более быстрым и точным RAG-системам для работы с большими объемами данных.
Источник: arXiv cs.CL ↗
