Vahe1994/SpQR

Инференс⭐ 556Python
Открыть на GitHub ↗

Что это за инструмент

SpQR — это инструмент для сжатия весов больших языковых моделей (LLM) с минимальными потерями качества, основанный на разреженном квантовании.

Зачем нужен

Решает проблему высокого потребления памяти при запуске больших моделей, позволяя сжимать их до 3-4 бит на вес. Это делает возможным запуск моделей уровня LLaMA-65B или Falcon-40B на оборудовании с ограниченной видеопамятью (VRAM) без значительного ухудшения метрик перплексии.

Что можно реализовать

  • Запуск больших LLM (LLaMA, Falcon, OPT) на GPU с 24-32 ГБ VRAM вместо 80 ГБ
  • Оценка качества сжатых моделей с помощью бенчмарков перплексии (WikiText2, C4)
  • Проведение zero-shot тестирования сжатых моделей через LM Evaluation Harness
  • Эксперименты с параметрами квантования для поиска баланса между размером модели и точностью
  • Сжатие моделей с использованием специфичных для них датасетов (RedPajama для LLaMA, RefinedWeb для Falcon)

Ключевые возможности

  • Поддержка архитектур LLaMA, Falcon и OPT
  • Гибкая настройка параметров квантования (битность весов, размер групп, обработка выбросов)
  • Опция offload activations для снижения требований к VRAM за счет использования RAM
  • Интеграция с Weights and Biases для логирования экспериментов
  • Использование предобработанных датасетов для более точного квантования

👤 Кому подойдёт: ML-инженеры и исследователи, работающие с оптимизацией и деплоем больших языковых моделей на ограниченном оборудовании

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.