vLLM Ascend v0.23.0: полная поддержка DeepSeek V4 на Ascend 950, новые модели и оптимизации графов.
- Added: Добавлена полная поддержка DeepSeek V4 на Ascend 950, включая DSA attention, MTP и MXFP-квантование.
- Added: Расширен список поддерживаемых моделей: GLM-5.2, Qwen3.5/3.6, Kimi-K3, Gemma4 и другие.
- Added: Включен режим графов FULL_AND_PIECEWISE по умолчанию, улучшено асинхронное планирование и speculative execution.
- Added: Улучшена работа с KV-cache: добавлена гибридная префиксная кэш-память и оффлоуд на CPU/SSD.
- Added: Добавлена поддержка контекстной параллельности (Context Parallelism) и разреженного внимания для длинных контекстов.