IST-DASLab/gptq

Код к статье ICLR 2023 "GPTQ: Accurate Post-training Quantization of Generative Pretrained Transformers".

Инференс⭐ 2 376Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

GPTQ — это инструмент для точного постобучающего квантования больших языковых моделей (LLM) с использованием алгоритма на основе Hessian-матриц, позволяющего значительно сократить размер модели без критической потери качества.

Зачем нужен

Инструмент решает задачу сжатия генеративных трансформеров (OPT, BLOOM, LLaMA) до 2, 3 или 4 бит, обеспечивая более высокую точность по сравнению с простыми методами квантования (RTN). Это полезно для развертывания больших моделей на GPU с ограниченной памятью и ускорения генерации текста за счет оптимизированных CUDA-ядер.

Что можно реализовать

  • Квантование моделей семейств OPT и BLOOM до 2/3/4 бит с оценкой перплексии на задачах генерации текста.
  • Применение квантования к моделям LLaMA с использованием оптимизаций `--act-order` и `--true-sequential` для улучшения точности на 7B-моделях.
  • Запуск ZeroShot-оценок производительности квантованных моделей на различных задачах.
  • Бенчмаркинг скорости генерации с использованием специализированных 3-битных CUDA-ядер (особенно эффективных на A100).
  • Сравнение качества квантования GPTQ с базовым методом nearest-neighbor (RTN) на датасетах C4 и PTB.

Ключевые возможности

  • Поддержка квантования моделей OPT, BLOOM и LLaMA до 2, 3 и 4 бит.
  • Оптимизированные 3-битные CUDA-ядра, обеспечивающие ускорение генерации (до 3.25x для OPT-175B на A100).
  • Гибкие параметры квантования: `--static-groups`, `--act-order`, `--true-sequential` для повышения точности.
  • Встроенные скрипты для оценки перплексии и ZeroShot-задач.
  • Возможность работы с моделями разного размера, включая 175B-параметров (при наличии доступа от Meta).

👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики, оптимизирующие развертывание больших языковых моделей на GPU.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.