Lightning-AI/lit-llama

Реализация языковой модели LLaMA на базе nanoGPT. Поддерживает flash attention, квантование Int8 и GPTQ 4bit, fine-tuning с LoRA и LLaMA-Adapter, pre-training. Лицензия Apache 2.0.

Чат-UI⭐ 6 082Python
Открыть на GitHub ↗

Что это за инструмент

Lit-LLaMA — это легковесная реализация модели LLaMA на базе nanoGPT, позволяющая выполнять предобучение, дообучение и инференс с поддержкой квантования и адаптеров.

Зачем нужен

Инструмент решает задачу запуска LLM на потребительском оборудовании благодаря оптимизациям (Flash Attention, квантование Int8/4bit) и простому коду. Он полезен для тех, кто хочет избежать лицензионных ограничений GPL оригинального кода Meta, так как проект распространяется под Apache 2.0.

Что можно реализовать

  • Запуск инференса LLaMA 7B на GPU с ограниченной памятью (от 5 ГБ) с помощью GPTQ int4 квантования
  • Инструктивное дообучение модели на своих данных с использованием LoRA или LLaMA-Adapter
  • Предобучение (pre-training) языковых моделей с нуля
  • Исследование архитектуры LLaMA через простую однофайловую реализацию без лишнего boilerplate

Ключевые возможности

  • Поддержка квантования Int8 и GPTQ 4bit для снижения потребления GPU памяти
  • Методы дообучения LoRA и LLaMA-Adapter
  • Лицензия Apache 2.0 (в отличие от GPL у оригинала)
  • Оптимизация под потребительские GPU (bfloat16, flash attention)
  • Простая установка и запуск через pip и скрипты

👤 Кому подойдёт: Разработчики и исследователи, работающие с LLM, которым нужна открытая, оптимизированная и легко настраиваемая база для экспериментов с LLaMA на собственном оборудовании.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.