jingyaogong/minimind

🧠 Обучи LLM с 64M параметров с нуля всего за 2 часа!

Обучение⭐ 61 891Pythonпоследний релиз: v2
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Минималистичный open-source проект на PyTorch для обучения сверхмалого LLM (64M параметров) с нуля за 2 часа на одной GPU.

Зачем нужен

Позволяет разработчикам и исследователям полностью понять архитектуру и процесс обучения LLM, избегая абстракций готовых фреймворков. Проект демонстрирует полный цикл: от токенизации и pretrain до SFT, LoRA, RLHF (DPO/PPO/GRPO) и агентных сценариев.

Что можно реализовать

  • Обучение базовой модели (pretrain) и её дообучение (SFT) с нуля на собственных данных.
  • Применение методов RLHF и RLAIF (DPO, PPO, GRPO, CISPO) для улучшения качества ответов и безопасности модели.
  • Настройка агентных способностей (Tool Use, Agentic RL) для работы с внешними инструментами.
  • Эксперименты с архитектурными изменениями: MoE, диффузионные модели (dLM), линейная внимательность (Linear Attention).
  • Развертывание модели через vLLM, llama.cpp или ollama с поддержкой OpenAI API.

Ключевые возможности

  • Полная реализация ключевых алгоритмов (RLHF, RLAIF, YaRN) на чистом PyTorch без высокоуровневых обёрток.
  • Архитектура, совместимая с экосистемой Qwen3 (Dense и MoE), с поддержкой длинных контекстов через YaRN.
  • Низкий порог входа: стоимость обучения около 3 юаней и время всего 2 часа на GPU уровня NVIDIA 3090.
  • Готовые скрипты для всех этапов: от очистки данных и токенизации до интеграции с WebUI и API.
  • Поддержка современных функций: reasoning_content, tool_calls, open_thinking и адаптивное мышление.

👤 Кому подойдёт: Разработчики, изучающие внутреннее устройство LLM, исследователи, интересующиеся RLHF/RLAIF, и энтузиасты, желающие обучить свою первую модель с нуля.

Релизы

v2major
🕐 11 мес назад · релиз на GitHub ↗

minimind v2: запуск DeepSeek-V4, Qwen3, MoE, MCP, FlashAttention, улучшена производительность и совместимость.

  • Added: Добавлена поддержка моделей DeepSeek-V4 и Qwen3.
  • Added: Внедрена архитектура MoE (Mixture of Experts).
  • Added: Добавлена поддержка протокола MCP (Model Context Protocol).
  • Added: Интегрирован FlashAttention для ускорения работы.
  • Fixed: Улучшена общая производительность и совместимость.