Проблема «слепой» квантования
Большие модели рассуждений (LRM) требуют колоссальных вычислительных ресурсов. Стандартные методы сжатия, такие как uniform INT4-квантование, применяют одинаковую степень сжатия ко всем компонентам архитектуры. Это приводит к повреждению так называемых «reasoning circuits» — контуров, отвечающих за логические выводы. Авторы исследования, Леонард Твагирайезу и Прасенджит Митра, показывают, что такой подход парадоксальным образом увеличивает общее энергопотребление.
Парадокс энергоэффективности
Ключевое открытие статьи заключается в том, что INT4-квантование может заставлять модель генерировать более длинные цепочки рассуждений (chain-of-thought) для достижения правильного ответа. В результате экономия на вычислениях нивелируется увеличением длины вывода. На датасете GSM8K снижение пиковой мощности на 25% привело к чистому увеличению общего энергопотребления из-за удлинения процесса генерации.
Методология: Поиск уязвимых контуров
Команда разработала фреймворк, который профилирует уязвимость каждого модуля. Они провели сканирование возмущений (perturbation sweep) на калибровочном наборе данных для всех пар (слой, проекция) в моделях объемом 196–224 слоя. На основе этого они идентифицировали наиболее чувствительные контуры и восстановили их в формате FP16, оставив остальные части в INT4.
Результаты на бенчмарках
Метод показал Парето-оптимальные результаты, недоступные для равномерного сжатия. Модель R1-Qwen-7B с топ-10% защищенных контуров продемонстрировала значительный прирост точности на логических задачах при снижении затрат энергии. Сравнение эффективности представлено ниже:
| Метрика / Модель | Результат | Примечание |
|---|---|---|
| Датасеты | GSM8K, FOLIO, MATH-500, ProofWriter, MuSiQue | 5 ключевых бенчмарков для проверки логики |
| Точность (ProofWriter) | +12 pp (процентных пунктов) | По сравнению с базовой FP16 версией |
| Энергопотребление | -9.7% | Снижение затрат при сохранении/улучшении качества |
| Архитектурная особенность | Attention-проекции критичны для математики | Чувствительность различается в зависимости от задачи |
Вывод для индустрии
Исследование доказывает, что будущее энергоэффективного развертывания LLM лежит не в тотальном сжатии, а в «умном» распределении точности. Защита специфических нейронных контуров позволяет избежать «качественной деградации» при квантовании, делая запуск тяжелых логических моделей на GPU более рентабельным.
Источник: arXiv cs.AI ↗
