turboderp/exllama
Более эффективная по памяти переписанная версия реализации Llama из HF transformers для работы с квантованными весами.
Инференс⭐ 2 946Python
Что это за инструмент
ExLlama — это оптимизированная реализация Llama на Python/CUDA, предназначенная для быстрого и экономичного по памяти инференса с использованием 4-битных GPTQ-весов.
Зачем нужен
Инструмент решает проблему высокой нагрузки на VRAM и низкой скорости генерации в стандартных реализациях Hugging Face Transformers, позволяя запускать большие LLM на потребительских видеокартах. Он полезен для разработчиков, которым нужна максимальная эффективность использования ресурсов GPU при работе с квантованными моделями.
Что можно реализовать
- Локальный запуск LLM (Llama, Koala, WizardLM) на NVIDIA GPU с ограниченным объемом VRAM (например, 8-12 ГБ).
- Создание чат-ботов с использованием встроенного примера или Web UI.
- Интеграция ExLlama в другие проекты через Python-модуль для повышения скорости инференса.
- Развертывание LLM в изолированных контейнерах Docker для безопасности и удобства деплоя.
Ключевые возможности
- Значительная экономия VRAM за счет использования 4-битных GPTQ-весов.
- Высокая скорость генерации токенов на GPU серии RTX 30/40.
- Наличие готового Web UI и примера чат-бота.
- Поддержка Docker для изолированного запуска.
- Автоматическая компиляция CUDA-расширений при первом запуске.
👤 Кому подойдёт: разработчики, энтузиасты локальных LLM, исследователи, работающие с оптимизацией инференса на NVIDIA GPU
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.