princeton-nlp/LLM-Shearing
[ICLR 2024] Sheared LLaMA: ускорение предобучения LLM с помощью структурированного прунинга
Обучение⭐ 644Python
Что это за инструмент
Инструмент для ускорения предобучения языковых моделей (LLM) за счет структурированного прунинга (обрезки) существующих сильных базовых моделей.
Зачем нужен
Позволяет создавать эффективные модели малого размера, обрезая крупные модели (например, Llama-2-7B), что обходится в 3% от стоимости их полного предобучения с нуля. Это экономит вычислительные ресурсы и время, сохраняя высокое качество модели.
Что можно реализовать
- Создание компактных LLM для развертывания на ресурсоограниченных устройствах
- Ускорение процесса получения моделей среднего размера (1.3B, 2.7B) без полного обучения с нуля
- Исследование эффективности структурированного прунинга для оптимизации архитектуры LLM
- Получение instruction-tuned моделей (например, через ShareGPT) из обрезанных весов
Ключевые возможности
- Структурированный прунинг сильных базовых моделей (LLaMA, Pythia)
- Продолженное предобучение (continued pre-training) обрезанных моделей
- Интеграция с MosaicML Composer для оптимизации процесса обучения
- Готовые веса моделей Sheared-LLaMA и Sheared-Pythia на Hugging Face
- Скрипты для динамической загрузки данных и оценки (ICL eval)
👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, оптимизирующие затраты на обучение LLM, разработчики, создающие эффективные модели малого размера.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.