Релиз v4.5.3: поддержка новых моделей (Qwen3.8-Flash-Next, DeepSeek-V4), оптимизации Megatron и исправления обучения.
- Added: Добавлена поддержка моделей Qwen3.8-Flash-Next, DeepSeek-V4-Pro-0813, Ling-3.0, LLaVA-OneVision-2 и других.
- Added: Оптимизатор Megatron-SWIFT Muon теперь поддерживает разные скорости обучения для различных параметров.
- Added: OPD-дистилляция (GRPO) поддерживает раздельные визуальные входы для учителя и ученика.
- Added: Добавлен бэкенд vllm_kunlun для инференса и развертывания.
- Fixed: Исправлены ошибки обучения: DPO/IPO, совместимость с PyTorch 4.x и Python 3.14, работа с мультипроцессингом.
- Fixed: Устранены проблемы в RL: синхронизация весов vLLM, градиенты log-prob и согласованность токенов.