Исследования10 сентября 2026 г., 10:18 МСК🤖 Auto

Интеллектуальное сжатие LLM: защита цепочек рассуждений для экономии энергии

Исследователи представили метод Reasoning-Aware Compression, который защищает критические нейронные контуры больших моделей от избыточного квантования, снижая энергопотребление без потери качества логики.

Баннер новости 7154

Проблема «слепой» квантования

Большие модели рассуждений (LRM) требуют колоссальных вычислительных ресурсов. Стандартные методы сжатия, такие как uniform INT4-квантование, применяют одинаковую степень сжатия ко всем компонентам архитектуры. Это приводит к повреждению так называемых «reasoning circuits» — контуров, отвечающих за логические выводы. Авторы исследования, Леонард Твагирайезу и Прасенджит Митра, показывают, что такой подход парадоксальным образом увеличивает общее энергопотребление.

Парадокс энергоэффективности

Ключевое открытие статьи заключается в том, что INT4-квантование может заставлять модель генерировать более длинные цепочки рассуждений (chain-of-thought) для достижения правильного ответа. В результате экономия на вычислениях нивелируется увеличением длины вывода. На датасете GSM8K снижение пиковой мощности на 25% привело к чистому увеличению общего энергопотребления из-за удлинения процесса генерации.

Методология: Поиск уязвимых контуров

Команда разработала фреймворк, который профилирует уязвимость каждого модуля. Они провели сканирование возмущений (perturbation sweep) на калибровочном наборе данных для всех пар (слой, проекция) в моделях объемом 196–224 слоя. На основе этого они идентифицировали наиболее чувствительные контуры и восстановили их в формате FP16, оставив остальные части в INT4.

Результаты на бенчмарках

Метод показал Парето-оптимальные результаты, недоступные для равномерного сжатия. Модель R1-Qwen-7B с топ-10% защищенных контуров продемонстрировала значительный прирост точности на логических задачах при снижении затрат энергии. Сравнение эффективности представлено ниже:

Метрика / Модель Результат Примечание
Датасеты GSM8K, FOLIO, MATH-500, ProofWriter, MuSiQue 5 ключевых бенчмарков для проверки логики
Точность (ProofWriter) +12 pp (процентных пунктов) По сравнению с базовой FP16 версией
Энергопотребление -9.7% Снижение затрат при сохранении/улучшении качества
Архитектурная особенность Attention-проекции критичны для математики Чувствительность различается в зависимости от задачи

Вывод для индустрии

Исследование доказывает, что будущее энергоэффективного развертывания LLM лежит не в тотальном сжатии, а в «умном» распределении точности. Защита специфических нейронных контуров позволяет избежать «качественной деградации» при квантовании, делая запуск тяжелых логических моделей на GPU более рентабельным.

Источник: arXiv cs.AI ↗