mit-han-lab/llm-awq
[Лучшая статья MLSys 2024] AWQ: Активационно-ориентированное квантование весов для сжатия и ускорения LLM
Инференс⭐ 3 637Python
Что это за инструмент
AWQ — это метод квантования весов больших языковых моделей (LLM) до низкого битности (INT3/4) с сохранением точности за счет учета активаций.
Зачем нужен
Инструмент позволяет значительно сжать модели LLM и ускорить их инференс (в том числе на edge-устройствах) без существенной потери качества. Это полезно для развертывания больших моделей на ресурсоограниченном оборудовании или для снижения затрат на облачный инференс.
Что можно реализовать
- Быстрый инференс instruction-tuned моделей (например, Vicuna, Llama-3) на GPU (RTX 4090) или edge-устройствах (Jetson Orin).
- Запуск мультимодальных языковых моделей (VILA, LLaVA) с поддержкой обработки изображений и видео в 4-битном формате.
- Интеграция квантованных моделей в популярные фреймворки (vLLM, HuggingFace TGI, TensorRT-LLM) для продакшн-серверов.
- Развертывание LLM/VLM на устройствах без интернета с использованием TinyChat для on-device инференса.
Ключевые возможности
- Поддержка квантования весов до INT3/4 (W4A16) с минимальной потерей точности.
- Наличие пресчитанного зоопарка моделей (Llama-1/2/3, OPT, CodeLlama, VILA и др.) для быстрого старта.
- Высокая скорость инференса: до 2.7-2.9x ускорения на RTX 4090 и Jetson Orin по сравнению с FP16.
- Нативная интеграция в HuggingFace transformers, vLLM, TensorRT-LLM и другие экосистемы.
- Поддержка современных архитектур, включая DeepSeek-R1-Distilled и BF16 точность.
👤 Кому подойдёт: ML-инженеры, разработчики LLM-приложений, исследователи, оптимизирующие инференс на GPU и edge-устройствах.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.