Поддержка новых моделей, оптимизация загрузки на ROCm, симулятор и отключение хранения ответов по умолчанию.
- Added: Добавлена поддержка моделей GLM-5.3-Flash, Qwen3.8-Flash-Next, K2 Horizon, Nanbeige4.2, SenseNova-U1.5-8B-MoT, FastH3 и VDN-H3.
- Added: Введены маски выборки для RL-роллаутов с повышением пропускной способности до 52% и оптимизированная загрузка моделей на ROCm.
- Added: Реализован единый радиусный кэш для SWA, поддержка DSpark в PD-режиме с контекстным параллелизмом и CPU-симулятор планировщика.
- Added: Добавлены официальные Docker-образы для Intel XPU и поддержка DisallowedTokensLogitsProcessor вместе с масками выборки.
- Breaking: Хранение ответов API отключено по умолчанию; удалена устаревшая стратегия Prefill context parallelism v1.