Vahe1994/SpQR
Инференс⭐ 556Python
Что это за инструмент
SpQR — это инструмент для сжатия весов больших языковых моделей (LLM) с минимальными потерями качества, основанный на разреженном квантовании.
Зачем нужен
Решает проблему высокого потребления памяти при запуске больших моделей, позволяя сжимать их до 3-4 бит на вес. Это делает возможным запуск моделей уровня LLaMA-65B или Falcon-40B на оборудовании с ограниченной видеопамятью (VRAM) без значительного ухудшения метрик перплексии.
Что можно реализовать
- Запуск больших LLM (LLaMA, Falcon, OPT) на GPU с 24-32 ГБ VRAM вместо 80 ГБ
- Оценка качества сжатых моделей с помощью бенчмарков перплексии (WikiText2, C4)
- Проведение zero-shot тестирования сжатых моделей через LM Evaluation Harness
- Эксперименты с параметрами квантования для поиска баланса между размером модели и точностью
- Сжатие моделей с использованием специфичных для них датасетов (RedPajama для LLaMA, RefinedWeb для Falcon)
Ключевые возможности
- Поддержка архитектур LLaMA, Falcon и OPT
- Гибкая настройка параметров квантования (битность весов, размер групп, обработка выбросов)
- Опция offload activations для снижения требований к VRAM за счет использования RAM
- Интеграция с Weights and Biases для логирования экспериментов
- Использование предобработанных датасетов для более точного квантования
👤 Кому подойдёт: ML-инженеры и исследователи, работающие с оптимизацией и деплоем больших языковых моделей на ограниченном оборудовании
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.