IST-DASLab/gptq
Код к статье ICLR 2023 "GPTQ: Accurate Post-training Quantization of Generative Pretrained Transformers".
Что это за инструмент
GPTQ — это инструмент для точного постобучающего квантования больших языковых моделей (LLM) с использованием алгоритма на основе Hessian-матриц, позволяющего значительно сократить размер модели без критической потери качества.
Зачем нужен
Инструмент решает задачу сжатия генеративных трансформеров (OPT, BLOOM, LLaMA) до 2, 3 или 4 бит, обеспечивая более высокую точность по сравнению с простыми методами квантования (RTN). Это полезно для развертывания больших моделей на GPU с ограниченной памятью и ускорения генерации текста за счет оптимизированных CUDA-ядер.
Что можно реализовать
- Квантование моделей семейств OPT и BLOOM до 2/3/4 бит с оценкой перплексии на задачах генерации текста.
- Применение квантования к моделям LLaMA с использованием оптимизаций `--act-order` и `--true-sequential` для улучшения точности на 7B-моделях.
- Запуск ZeroShot-оценок производительности квантованных моделей на различных задачах.
- Бенчмаркинг скорости генерации с использованием специализированных 3-битных CUDA-ядер (особенно эффективных на A100).
- Сравнение качества квантования GPTQ с базовым методом nearest-neighbor (RTN) на датасетах C4 и PTB.
Ключевые возможности
- Поддержка квантования моделей OPT, BLOOM и LLaMA до 2, 3 и 4 бит.
- Оптимизированные 3-битные CUDA-ядра, обеспечивающие ускорение генерации (до 3.25x для OPT-175B на A100).
- Гибкие параметры квантования: `--static-groups`, `--act-order`, `--true-sequential` для повышения точности.
- Встроенные скрипты для оценки перплексии и ZeroShot-задач.
- Возможность работы с моделями разного размера, включая 175B-параметров (при наличии доступа от Meta).
👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики, оптимизирующие развертывание больших языковых моделей на GPU.