Jiayi-Pan/TinyZero
Minimal reproduction of DeepSeek R1-Zero
Обучение⭐ 13 237Python
Что это за инструмент
TinyZero — это минималистичная репродукция модели DeepSeek R1-Zero, демонстрирующая, как базовая языковая модель (LLM) самостоятельно развивает навыки рассуждения и самопроверки через обучение с подкреплением (RL).
Зачем нужен
Инструмент позволяет исследователям и разработчикам воспроизвести эксперимент по обучению моделей (например, Qwen2.5-3B) способности к поиску и верификации решений без предварительного инструктажа. Он полезен для понимания механизмов emergence reasoning и проведения собственных RL-экспериментов с низким бюджетом.
Что можно реализовать
- Воспроизведение результатов DeepSeek R1-Zero на задачах обратного отсчета и умножения.
- Обучение базовых LLM (до 3B параметров) навыкам самопроверки и поиска решений через RL.
- Проведение абляционных исследований (ablation studies) с использованием инструктивных моделей (Instruct).
- Тестирование эффективности обучения на одном GPU (для моделей <= 1.5B) или двух GPU (для 3B+).
Ключевые возможности
- Низкая стоимость эксперимента: запуск обучения обходится менее чем в $30.
- Использование фреймворка veRL для распределенного обучения с подкреплением.
- Поддержка различных бэкендов внимания (vLLM, XFORMERS) и оптимизаций (flash attention 2).
- Возможность работы с моделями разного размера: от 0.5B до 3B параметров.
- Прозрачность процесса: полная лог экспериментов доступна через Weights & Biases (wandb).
👤 Кому подойдёт: исследователи в области AI, разработчики, изучающие RLHF и reasoning, технические энтузиасты, интересующиеся внутренним устройством современных LLM
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.