Lightning-AI/lit-llama
Реализация языковой модели LLaMA на базе nanoGPT. Поддерживает flash attention, квантование Int8 и GPTQ 4bit, fine-tuning с LoRA и LLaMA-Adapter, pre-training. Лицензия Apache 2.0.
Что это за инструмент
Lit-LLaMA — это легковесная реализация модели LLaMA на базе nanoGPT, позволяющая выполнять предобучение, дообучение и инференс с поддержкой квантования и адаптеров.
Зачем нужен
Инструмент решает задачу запуска LLM на потребительском оборудовании благодаря оптимизациям (Flash Attention, квантование Int8/4bit) и простому коду. Он полезен для тех, кто хочет избежать лицензионных ограничений GPL оригинального кода Meta, так как проект распространяется под Apache 2.0.
Что можно реализовать
- Запуск инференса LLaMA 7B на GPU с ограниченной памятью (от 5 ГБ) с помощью GPTQ int4 квантования
- Инструктивное дообучение модели на своих данных с использованием LoRA или LLaMA-Adapter
- Предобучение (pre-training) языковых моделей с нуля
- Исследование архитектуры LLaMA через простую однофайловую реализацию без лишнего boilerplate
Ключевые возможности
- Поддержка квантования Int8 и GPTQ 4bit для снижения потребления GPU памяти
- Методы дообучения LoRA и LLaMA-Adapter
- Лицензия Apache 2.0 (в отличие от GPL у оригинала)
- Оптимизация под потребительские GPU (bfloat16, flash attention)
- Простая установка и запуск через pip и скрипты
👤 Кому подойдёт: Разработчики и исследователи, работающие с LLM, которым нужна открытая, оптимизированная и легко настраиваемая база для экспериментов с LLaMA на собственном оборудовании.