modelscope/ms-swift

Использование PEFT или полного параметра для CPT/SFT/DPO/GRPO более чем 600 LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) и 300+ MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

Обучение⭐ 15 702Pythonпоследний релиз: v4.5.3
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

SWIFT — это фреймворк от ModelScope для полного цикла работы с LLM и MLLM: от обучения (pre-training, fine-tuning, RL) до инференса, оценки и деплоя.

Зачем нужен

Инструмент упрощает настройку 600+ текстовых и 400+ мультимодальных моделей, предоставляя готовые шаблоны и поддержку новейших алгоритмов (GRPO, DPO, LoRA). Он полезен для оптимизации ресурсов (через квантование и параллелизм) и ускорения вывода моделей (vLLM, SGLang).

Что можно реализовать

  • Быстрый fine-tuning популярных моделей (Qwen3, Llama4, InternLM3) с использованием PEFT-методов (LoRA, QLoRA) или полного переобучения.
  • Обучение мультимодальных моделей (Qwen3-VL, Llava) с поддержкой смешанных данных (текст, изображения, видео, аудио) и оптимизацией памяти.
  • Применение алгоритмов reinforcement learning (GRPO, DAPO, RLOO) для улучшения alignment модели с человеческими предпочтениями.
  • Деплой и инференс моделей с использованием ускорителей vLLM, SGLang и LMDeploy, а также квантование (GPTQ, AWQ, BNB).
  • Обучение Embedding/Reranker моделей и задач классификации последовательностей.

Ключевые возможности

  • Поддержка 600+ текстовых и 400+ мультимодальных моделей с Day-0 поддержкой новинок.
  • Встроенные алгоритмы RL: GRPO, DAPO, GSPO, SAPO, CISPO, RLOO, Reinforce++.
  • Масштабируемый параллелизм: Megatron (TP, PP, CP, EP), DeepSpeed ZeRO, FSDP.
  • Оптимизация памяти: GaLore, UnSloth, Liger-Kernel, Flash-Attention 2/3, Ulysses/Ring-Attention.
  • Кросс-платформенность: поддержка NVIDIA GPU, AMD, CPU, MPS и Ascend NPU.

👤 Кому подойдёт: ML-инженеры, исследователи и разработчики, занимающиеся fine-tuning, RLHF и деплоем больших языковых и мультимодальных моделей.

Релизы

v4.5.3minor
🕐 14 дн назад · релиз на GitHub ↗

Релиз v4.5.3: поддержка новых моделей (Qwen3.8-Flash-Next, DeepSeek-V4), оптимизации Megatron и исправления обучения.

  • Added: Добавлена поддержка моделей Qwen3.8-Flash-Next, DeepSeek-V4-Pro-0813, Ling-3.0, LLaVA-OneVision-2 и других.
  • Added: Оптимизатор Megatron-SWIFT Muon теперь поддерживает разные скорости обучения для различных параметров.
  • Added: OPD-дистилляция (GRPO) поддерживает раздельные визуальные входы для учителя и ученика.
  • Added: Добавлен бэкенд vllm_kunlun для инференса и развертывания.
  • Fixed: Исправлены ошибки обучения: DPO/IPO, совместимость с PyTorch 4.x и Python 3.14, работа с мультипроцессингом.
  • Fixed: Устранены проблемы в RL: синхронизация весов vLLM, градиенты log-prob и согласованность токенов.
v4.5.2patch
🕐 1 мес назад · релиз на GitHub ↗

Исправлена ошибочная конфигурация size для модели Qwen3.8-35B-A3B, скопированная из предыдущей серии.

  • Fixed: Исправлена неверная конфигурация size для Qwen3.8-35B-A3B, которая ошибочно была скопирована из серии Qwen3.5/3.6.
v4.5.0major
🕐 1 мес назад · релиз на GitHub ↗

Релиз v4.5.0: добавлена поддержка Qwen3.8, Nemotron 3.5, Muse Glimmer, MiMo-V2.5 и DeepSeek-V4-Flash, исправлены баги GRPO и streaming.

  • Added: Добавлена поддержка моделей Qwen3.8, NVIDIA Nemotron 3.5 Lightning, Muse Glimmer, MiMo-V2.5 и DeepSeek-V4-Flash-0731.
  • Added: Реализована обработка сообщений форматов OpenAI и Anthropic, а также поддержка пустого контента и отдельных сообщений с инструментами.
  • Added: Введен масштабирование лосс-функции для префиксов размышления (thinking-prefix) и добавлена маска потерь для ответов.
  • Fixed: Исправлены ошибки в GRPO (совместимость с FSDP2, выгрузка метрик, инъекция LoRARequest) и маршрутизации Qwen3.5.
  • Fixed: Устранены проблемы с экспортом LoRA с квантованием, streaming logprobs, обработкой BF16 на NPU и закрытием event loops.
v4.4.3minor
🕐 1 мес назад · релиз на GitHub ↗

Поддержка Qwen3.5, DeepSeek-V4, Hy3, GRPO с RLSD и оптимизация Megatron/NCCL.

  • Added: Добавлена поддержка моделей Qwen3.5, DeepSeek-V4, Hy3, GKD multi-turn и Qwen3-TTS.
  • Added: В GRPO внедрены RLSD self-distilled advantage reweighting и SDAR confidence-gated teacher distillation loss.
  • Added: Добавлен опциональный бэкенд megatron-bridge и улучшена стратегия упаковки (packing_strategy).
  • Fixed: Исправлены шаблоны для Qwen3.5, Qwen3-TTS и Hy3, а также ошибки в логике GRPO и Megatron rollout.
  • Fixed: Устранена ошибка OOM cudaMalloc в NCCL при итерации 1 и исправлена обработка loss в Qwen3-TTS.
v4.4.2minor
🕐 2 мес назад · релиз на GitHub ↗

Релиз v4.4.2 библиотеки ms-swift с улучшениями производительности и поддержки новых моделей.

  • Added: Добавлена поддержка архитектуры MoE для модели DeepSeek-V4.
  • Added: Реализована интеграция с протоколом MCP.
  • Added: Добавлена поддержка модели Qwen3.
  • Fixed: Исправлена работа FlashAttention в специфичных конфигурациях.
  • Fixed: Устранены ошибки при запуске некоторых примеров.
v4.4.0major
🕐 2 мес назад · релиз на GitHub ↗

Релиз v4.4.0: поддержка GLM-5.2, Kimi-K2.7-Code, DLLM и Qwen3-TTS, рефакторинг RL и новые возможности обучения.

  • Added: Добавлена поддержка новых моделей: GLM-5.2, Kimi-K2.7-Code, MiniMax-M3, Unlimited-OCR и DiffusionGemma.
  • Added: В RL-тренинге GRPO/GKD реализована поддержка OPD, Multi-teacher и выполнен рефакторинг Trainer.
  • Added: В训练 добавлена поддержка DLLM (DiffusionGemma), Qwen3-TTS, MRL для Embedding и ConcatLossScale.
  • Added: Megatron-SWIFT обновлен до NPU Megatron-Core 0.16 и поддерживает GLM-5.2 и minicpmv4_6.
  • Fixed: Исправлены проблемы с DeepSeek-V4 FP8, серверным режимом Megatron и типами данных в MeanMetric.