Проблема статического сжатия на edge-устройствах
Retrieval-Augmented Generation (RAG) улучшает ответы языковых моделей за счет внешних данных, но это создает серьезные накладные расходы: удлинение промпта увеличивает объем префиллинга, размер KV-cache, трафик памяти, задержки и энергопотребление. Традиционные методы сжатия контекста (например, LLMLingua-2) используют фиксированный бюджет сжатия, выбранный оффлайн. Этот статический подход игнорирует вариативность рабочей нагрузки и текущее состояние edge-устройства. На SoC-чипе компрессия сама по себе требует вычислительных ресурсов, что может нивелировать экономию от генерации.
Экспериментальная платформа и метрики
Авторы провели комплексную оценку на платформе NVIDIA Jetson AGX Thor, используя генераторы Llama и Qwen (модели 7B-8B) и датасеты Natural Questions и HotpotQA. Ключевым открытием стало то, что для больших моделей именно этап генерации доминирует в бюджете RAG, составляя около 90% времени отклика и 91% энергопотребления GPU. Это делает оптимизацию этапа генерации критически важной.
Результаты: «Золотая середина» сжатия
Исследование выявило адаптивную область работы, где умеренное сжатие дает максимальный эффект. Чрезмерно агрессивное сжатие ухудшает качество инференса, а слишком слабое — упускает возможности экономии. Оптимальные параметры позволили достичь значительного снижения энергозатрат при сохранении качества ответов.
| Метрика | Показатель | Примечание |
|---|---|---|
| Доля генерации в задержке | ~90% | Для моделей 7B-8B |
| Доля генерации в энергии GPU | 91% | Для моделей 7B-8B |
| Снижение энергии GPU | до 53.2% | При оптимальном сжатии |
| Снижение энергии SoC | до 48.2% | При оптимальном сжатии |
| Потеря качества | Пренебрежимо мала | При использовании адаптивных политик |
Вектор развития: Telemetry-informed policies
Авторы предлагают отказаться от статических политик в пользу runtime-политик, управляемых телеметрией. Такие системы должны динамически управлять степенью сжатия, опираясь на признаки рабочей нагрузки и данные о состоянии edge-устройства в реальном времени. Работа принята к публикации в Proceedings of the ACM AI Leadership Summit 2026.
Источник: arXiv cs.AI ↗
