Исследования21 августа 2026 г., 08:18 МСК🤖 Auto

Адаптивное сжатие RAG на edge: экономия до 53% энергии

Исследователи из Northeastern University представили метод динамической компрессии контекста для RAG-систем на NVIDIA Jetson AGX Thor, снижающий энергопотребление GPU почти вдвое без потери качества ответов.

Баннер новости 6212

Проблема статического сжатия на edge-устройствах

Retrieval-Augmented Generation (RAG) улучшает ответы языковых моделей за счет внешних данных, но это создает серьезные накладные расходы: удлинение промпта увеличивает объем префиллинга, размер KV-cache, трафик памяти, задержки и энергопотребление. Традиционные методы сжатия контекста (например, LLMLingua-2) используют фиксированный бюджет сжатия, выбранный оффлайн. Этот статический подход игнорирует вариативность рабочей нагрузки и текущее состояние edge-устройства. На SoC-чипе компрессия сама по себе требует вычислительных ресурсов, что может нивелировать экономию от генерации.

Экспериментальная платформа и метрики

Авторы провели комплексную оценку на платформе NVIDIA Jetson AGX Thor, используя генераторы Llama и Qwen (модели 7B-8B) и датасеты Natural Questions и HotpotQA. Ключевым открытием стало то, что для больших моделей именно этап генерации доминирует в бюджете RAG, составляя около 90% времени отклика и 91% энергопотребления GPU. Это делает оптимизацию этапа генерации критически важной.

Результаты: «Золотая середина» сжатия

Исследование выявило адаптивную область работы, где умеренное сжатие дает максимальный эффект. Чрезмерно агрессивное сжатие ухудшает качество инференса, а слишком слабое — упускает возможности экономии. Оптимальные параметры позволили достичь значительного снижения энергозатрат при сохранении качества ответов.

Метрика Показатель Примечание
Доля генерации в задержке ~90% Для моделей 7B-8B
Доля генерации в энергии GPU 91% Для моделей 7B-8B
Снижение энергии GPU до 53.2% При оптимальном сжатии
Снижение энергии SoC до 48.2% При оптимальном сжатии
Потеря качества Пренебрежимо мала При использовании адаптивных политик

Вектор развития: Telemetry-informed policies

Авторы предлагают отказаться от статических политик в пользу runtime-политик, управляемых телеметрией. Такие системы должны динамически управлять степенью сжатия, опираясь на признаки рабочей нагрузки и данные о состоянии edge-устройства в реальном времени. Работа принята к публикации в Proceedings of the ACM AI Leadership Summit 2026.

Источник: arXiv cs.AI ↗