huggingface/open-r1

Fully open reproduction of DeepSeek-R1

Обучение⭐ 26 478Python
Открыть на GitHub ↗

Что это за инструмент

Open R1 — это полностью открытый репозиторий для воспроизведения и изучения пайплайна обучения модели DeepSeek-R1, включая дистилляцию знаний и обучение через подкрепление (RL).

Зачем нужен

Инструмент позволяет исследователям и разработчикам самостоятельно воссоздать архитектуру и методы обучения R1-подобных моделей, не полагаясь на закрытые проприетарные решения. Он полезен для понимания внутренних механизмов reasoning-моделей, создания собственных датасетов с цепочками рассуждений и настройки моделей под специфические задачи через SFT и GRPO.

Что можно реализовать

  • Воспроизведение результатов дистилляции знаний от DeepSeek-R1 для создания более легких моделей (например, OpenR1-Distill-7B).
  • Обучение моделей методом прямого градиентного подкрепления (GRPO) на синтетических данных для улучшения навыков логического вывода.
  • Генерация и курирование больших датасетов с верифицированными рассуждениями (CoT) для математики, кода и науки.
  • Исследование многоэтапного обучения: переход от базовой модели к RL-оптимизированной версии.

Ключевые возможности

  • Полная открытость: доступ к скриптам для SFT, GRPO и генерации данных (через Distilabel).
  • Готовые датасеты: наличие курированных наборов данных, таких как Mixture-of-Thoughts (350k примеров) и CodeForces-CoTs.
  • Поддержка современного стека: совместимость с vLLM 0.8.5, FlashAttention и PyTorch 2.6.0.
  • Документированный план атаки: четкая дорожная карта от дистилляции до чистого RL-обучения (R1-Zero).
  • Интеграция с экосистемой Hugging Face: легкая загрузка моделей и датасетов, логирование через Weights and Biases.

👤 Кому подойдёт: AI-исследователи, ML-инженеры, разработчики, работающие с LLM и оптимизацией моделей подкреплением.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.