Исследования22 сентября 2026 г., 12:19 МСК🤖 Auto

AdaMem: Умная компрессия памяти для RAG с ускорением в 4 раза

Исследователи представили AdaMem — метод адаптивного выделения токенов памяти в RAG-системах, который повышает точность ответов и снижает задержку генерации.

Баннер новости 8030

Проблема равномерной компрессии в RAG

Retrieval-Augmented Generation (RAG) улучшает языковые модели за счет извлечения доказательств, но обработка длинных фрагментов требует вычислительных ресурсов и может добавлять шум. Существующие методы мягкой компрессии (soft compression) кодируют фрагменты в компактные непрерывные эмбеддинги, но обычно назначают одинаковое количество токенов памяти каждому фрагменту, игнорируя его релевантность запросу. Это приводит к неэффективному использованию ограниченного бюджета памяти.

Решение: AdaMem

Авторы предлагают AdaMem — фреймворк, который использует оценки релевантности фрагментов для адаптивного распределения фиксированного бюджета токенов памяти. Общий компрессор, зависящий от запроса, одновременно генерирует непрерывные памяти фрагментов и их релевантность. Детерминированное правило выделяет больше токенов высоко-релевантным фрагментам и полностью исключает низко-релевантные.

Результаты бенчмарков

Метод протестирован на шести открыто-доменных QA-бенчмарках. AdaMem превосходит OSCAR (базовый метод с равномерным распределением) и другие подходы мягкой компрессии при сопоставимых бюджетах памяти. Ключевые метрики эффективности:

Параметр Результат AdaMem Сравнение с базой (OSCAR)
Стандартная компрессия (16x) Улучшение sub-string match +3.2 балла (5.5%)
Средний относительный прирост: 3.4%
Агрессивная компрессия (64x) Улучшение sub-string match Средний прирост: 14.6%
Максимум на PopQA: +9.8 балла (19.7%)
Скорость инференса Задержка (latency) До 4x быстрее, чем полный контекст
Сопоставима с равномерной компрессией

Значение для индустрии

AdaMem демонстрирует, что релевантно-управляемое распределение памяти особенно эффективно при больших пулах извлечения и жестких ограничениях памяти. Метод сохраняет качество ответов на уровне несжатого контекста при задержке, в 4 раза меньшей, чем у полнотекстового инференса. Это открывает путь к более быстрым и точным RAG-системам для работы с большими объемами данных.

Источник: arXiv cs.CL ↗