tatsu-lab/stanford_alpaca
Код и документация для обучения моделей Alpaca от Стэнфорда и генерации данных.
Чат-UI⭐ 30 233Python
Что это за инструмент
Инструмент для генерации датасета инструкций и дообучения (fine-tuning) модели LLaMA на 52 000 примеров, чтобы она научилась следовать инструкциям.
Зачем нужен
Позволяет создать модель, поведение которой на тестовом наборе инструкций сопоставимо с text-davinci-003. Полезен для воспроизведения результатов исследования Self-Instruct и получения базовой модели, следующей инструкциям, без использования платных API.
Что можно реализовать
- Генерация 52K уникальных инструкций с использованием OpenAI API (text-davinci-003)
- Fine-tuning 7B модели LLaMA на сгенерированных данных
- Восстановление весов Alpaca-7B из опубликованного weight diff
- Создание собственного датасета инструкций по методологии Self-Instruct
Ключевые возможности
- Готовый датасет alpaca_data.json с инструкциями, контекстом и ответами
- Код для автоматической генерации данных через OpenAI
- Рецепты для fine-tuning LLaMA
- Механизм восстановления весов из diff-файла
- Открытый код под лицензией Apache 2.0
👤 Кому подойдёт: Исследователи, разработчики LLM, специалисты по машинному обучению, интересующиеся instruction-tuning и воспроизводимостью исследований.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.