turboderp/exllama

Более эффективная по памяти переписанная версия реализации Llama из HF transformers для работы с квантованными весами.

Инференс⭐ 2 946Python
Открыть на GitHub ↗

Что это за инструмент

ExLlama — это оптимизированная реализация Llama на Python/CUDA, предназначенная для быстрого и экономичного по памяти инференса с использованием 4-битных GPTQ-весов.

Зачем нужен

Инструмент решает проблему высокой нагрузки на VRAM и низкой скорости генерации в стандартных реализациях Hugging Face Transformers, позволяя запускать большие LLM на потребительских видеокартах. Он полезен для разработчиков, которым нужна максимальная эффективность использования ресурсов GPU при работе с квантованными моделями.

Что можно реализовать

  • Локальный запуск LLM (Llama, Koala, WizardLM) на NVIDIA GPU с ограниченным объемом VRAM (например, 8-12 ГБ).
  • Создание чат-ботов с использованием встроенного примера или Web UI.
  • Интеграция ExLlama в другие проекты через Python-модуль для повышения скорости инференса.
  • Развертывание LLM в изолированных контейнерах Docker для безопасности и удобства деплоя.

Ключевые возможности

  • Значительная экономия VRAM за счет использования 4-битных GPTQ-весов.
  • Высокая скорость генерации токенов на GPU серии RTX 30/40.
  • Наличие готового Web UI и примера чат-бота.
  • Поддержка Docker для изолированного запуска.
  • Автоматическая компиляция CUDA-расширений при первом запуске.

👤 Кому подойдёт: разработчики, энтузиасты локальных LLM, исследователи, работающие с оптимизацией инференса на NVIDIA GPU

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.