mit-han-lab/smoothquant

[ICML 2023] SmoothQuant: точное и эффективное постобучающее квантование для больших языковых моделей

Инференс⭐ 1 686Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

SmoothQuant — это метод постобучающей квантования (PTQ) без дообучения, позволяющий преобразовывать модели LLM в формат INT8 (W8A8) путем сглаживания выбросов активаций.

Зачем нужен

Инструмент решает проблему высокой вычислительной сложности и затрат памяти при работе с большими языковыми моделями (LLM). Он позволяет достичь ускорения инференса и сокращения объема памяти до 2x с сохранением точности, что снижает стоимость развертывания моделей.

Что можно реализовать

  • Развертывание LLM с более чем 100 млрд параметров (например, OPT-175B, MT-NLG 530B) на ограниченном количестве GPU.
  • Ускорение инференса Llama, Mistral, Mixtral, Falcon и других моделей с квантованием весов и активаций до INT8 (W8A8).
  • Интеграция квантованных моделей в промышленные фреймворки, такие как NVIDIA TensorRT-LLM, Microsoft ONNX Runtime и Amazon SageMaker.
  • Запуск обслуживания (serving) огромных моделей в пределах одного серверного узла (single node) вместо распределенного кластера.

Ключевые возможности

  • Поддержка квантования W8A8 (INT8 для весов и активаций) без потери точности по сравнению с FP16.
  • Механизм сглаживания активаций (smoothing) для переноса сложности квантования с активаций на веса.
  • Готовая интеграция в ключевые инфраструктурные решения: FasterTransformer, TensorRT-LLM, Intel Neural-Compressor.
  • Предоставление предварительно обработанных INT8 моделей и скриптов для генерации масштабов активаций (act_scales) для популярных архитектур.
  • Демонстрация ускорения до 1.56x и сокращения памяти в 2x на примере моделей OPT.

👤 Кому подойдёт: ML-инженеры, разработчики MLOps, исследователи, работающие с оптимизацией инференса LLM, и компании, стремящиеся снизить затраты на GPU-инфраструктуру.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.