huggingface/open-r1
Fully open reproduction of DeepSeek-R1
Обучение⭐ 26 478Python
Что это за инструмент
Open R1 — это полностью открытый репозиторий для воспроизведения и изучения пайплайна обучения модели DeepSeek-R1, включая дистилляцию знаний и обучение через подкрепление (RL).
Зачем нужен
Инструмент позволяет исследователям и разработчикам самостоятельно воссоздать архитектуру и методы обучения R1-подобных моделей, не полагаясь на закрытые проприетарные решения. Он полезен для понимания внутренних механизмов reasoning-моделей, создания собственных датасетов с цепочками рассуждений и настройки моделей под специфические задачи через SFT и GRPO.
Что можно реализовать
- Воспроизведение результатов дистилляции знаний от DeepSeek-R1 для создания более легких моделей (например, OpenR1-Distill-7B).
- Обучение моделей методом прямого градиентного подкрепления (GRPO) на синтетических данных для улучшения навыков логического вывода.
- Генерация и курирование больших датасетов с верифицированными рассуждениями (CoT) для математики, кода и науки.
- Исследование многоэтапного обучения: переход от базовой модели к RL-оптимизированной версии.
Ключевые возможности
- Полная открытость: доступ к скриптам для SFT, GRPO и генерации данных (через Distilabel).
- Готовые датасеты: наличие курированных наборов данных, таких как Mixture-of-Thoughts (350k примеров) и CodeForces-CoTs.
- Поддержка современного стека: совместимость с vLLM 0.8.5, FlashAttention и PyTorch 2.6.0.
- Документированный план атаки: четкая дорожная карта от дистилляции до чистого RL-обучения (R1-Zero).
- Интеграция с экосистемой Hugging Face: легкая загрузка моделей и датасетов, логирование через Weights and Biases.
👤 Кому подойдёт: AI-исследователи, ML-инженеры, разработчики, работающие с LLM и оптимизацией моделей подкреплением.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.