mit-han-lab/llm-awq

[Лучшая статья MLSys 2024] AWQ: Активационно-ориентированное квантование весов для сжатия и ускорения LLM

Инференс⭐ 3 637Python
Открыть на GitHub ↗

Что это за инструмент

AWQ — это метод квантования весов больших языковых моделей (LLM) до низкого битности (INT3/4) с сохранением точности за счет учета активаций.

Зачем нужен

Инструмент позволяет значительно сжать модели LLM и ускорить их инференс (в том числе на edge-устройствах) без существенной потери качества. Это полезно для развертывания больших моделей на ресурсоограниченном оборудовании или для снижения затрат на облачный инференс.

Что можно реализовать

  • Быстрый инференс instruction-tuned моделей (например, Vicuna, Llama-3) на GPU (RTX 4090) или edge-устройствах (Jetson Orin).
  • Запуск мультимодальных языковых моделей (VILA, LLaVA) с поддержкой обработки изображений и видео в 4-битном формате.
  • Интеграция квантованных моделей в популярные фреймворки (vLLM, HuggingFace TGI, TensorRT-LLM) для продакшн-серверов.
  • Развертывание LLM/VLM на устройствах без интернета с использованием TinyChat для on-device инференса.

Ключевые возможности

  • Поддержка квантования весов до INT3/4 (W4A16) с минимальной потерей точности.
  • Наличие пресчитанного зоопарка моделей (Llama-1/2/3, OPT, CodeLlama, VILA и др.) для быстрого старта.
  • Высокая скорость инференса: до 2.7-2.9x ускорения на RTX 4090 и Jetson Orin по сравнению с FP16.
  • Нативная интеграция в HuggingFace transformers, vLLM, TensorRT-LLM и другие экосистемы.
  • Поддержка современных архитектур, включая DeepSeek-R1-Distilled и BF16 точность.

👤 Кому подойдёт: ML-инженеры, разработчики LLM-приложений, исследователи, оптимизирующие инференс на GPU и edge-устройствах.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.