Jiayi-Pan/TinyZero

Minimal reproduction of DeepSeek R1-Zero

Обучение⭐ 13 237Python
Открыть на GitHub ↗

Что это за инструмент

TinyZero — это минималистичная репродукция модели DeepSeek R1-Zero, демонстрирующая, как базовая языковая модель (LLM) самостоятельно развивает навыки рассуждения и самопроверки через обучение с подкреплением (RL).

Зачем нужен

Инструмент позволяет исследователям и разработчикам воспроизвести эксперимент по обучению моделей (например, Qwen2.5-3B) способности к поиску и верификации решений без предварительного инструктажа. Он полезен для понимания механизмов emergence reasoning и проведения собственных RL-экспериментов с низким бюджетом.

Что можно реализовать

  • Воспроизведение результатов DeepSeek R1-Zero на задачах обратного отсчета и умножения.
  • Обучение базовых LLM (до 3B параметров) навыкам самопроверки и поиска решений через RL.
  • Проведение абляционных исследований (ablation studies) с использованием инструктивных моделей (Instruct).
  • Тестирование эффективности обучения на одном GPU (для моделей <= 1.5B) или двух GPU (для 3B+).

Ключевые возможности

  • Низкая стоимость эксперимента: запуск обучения обходится менее чем в $30.
  • Использование фреймворка veRL для распределенного обучения с подкреплением.
  • Поддержка различных бэкендов внимания (vLLM, XFORMERS) и оптимизаций (flash attention 2).
  • Возможность работы с моделями разного размера: от 0.5B до 3B параметров.
  • Прозрачность процесса: полная лог экспериментов доступна через Weights & Biases (wandb).

👤 Кому подойдёт: исследователи в области AI, разработчики, изучающие RLHF и reasoning, технические энтузиасты, интересующиеся внутренним устройством современных LLM

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.