tatsu-lab/stanford_alpaca

Код и документация для обучения моделей Alpaca от Стэнфорда и генерации данных.

Чат-UI⭐ 30 233Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Инструмент для генерации датасета инструкций и дообучения (fine-tuning) модели LLaMA на 52 000 примеров, чтобы она научилась следовать инструкциям.

Зачем нужен

Позволяет создать модель, поведение которой на тестовом наборе инструкций сопоставимо с text-davinci-003. Полезен для воспроизведения результатов исследования Self-Instruct и получения базовой модели, следующей инструкциям, без использования платных API.

Что можно реализовать

  • Генерация 52K уникальных инструкций с использованием OpenAI API (text-davinci-003)
  • Fine-tuning 7B модели LLaMA на сгенерированных данных
  • Восстановление весов Alpaca-7B из опубликованного weight diff
  • Создание собственного датасета инструкций по методологии Self-Instruct

Ключевые возможности

  • Готовый датасет alpaca_data.json с инструкциями, контекстом и ответами
  • Код для автоматической генерации данных через OpenAI
  • Рецепты для fine-tuning LLaMA
  • Механизм восстановления весов из diff-файла
  • Открытый код под лицензией Apache 2.0

👤 Кому подойдёт: Исследователи, разработчики LLM, специалисты по машинному обучению, интересующиеся instruction-tuning и воспроизводимостью исследований.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.