vllm-project/vllm-ascend

Плагин для оборудования, поддерживаемый сообществом, для vLLM на Ascend

Инференс⭐ 2 860C++последний релиз: v0.23.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

vllm-ascend — это плагин с открытым исходным кодом, поддерживаемый сообществом, который позволяет запускать inference-движок vLLM на нейронных процессорах (NPU) Huawei Ascend.

Зачем нужен

Инструмент решает задачу аппаратной совместимости, обеспечивая бесшовное выполнение моделей LLM на инфраструктуре Ascend без необходимости модификации ядра vLLM. Он полезен для организаций, использующих NPU Huawei, так как предоставляет официальный и поддерживаемый способ развертывания популярных open-source моделей на этом оборудовании.

Что можно реализовать

  • Развертывание inference-серверов на базе NPU Ascend для обслуживания LLM
  • Запуск моделей с архитектурой Mixture-of-Experts (MoE) на Ascend
  • Использование мульти-модальных LLM (Multi-modal LLMs) на NPU
  • Масштабирование нагрузок с использованием Expert Parallelism (EP) на кластерах Ascend

Ключевые возможности

  • Поддержка широкого спектра моделей: Transformer-like, MoE, Embedding и Multi-modal
  • Соответствие стандарту Hardware pluggable от vLLM community
  • Активная разработка и релизы (версии v0.7.3 — v0.18.0 в 2025-2026 гг.)
  • Наличие официальной документации и сообщества (Slack, Users Forum)

👤 Кому подойдёт: Инженеры по машинному обучению, DevOps-инженеры и архитекторы, работающие с инфраструктурой Huawei Ascend и внедряющие vLLM для инференса LLM

Релизы

v0.23.0major
🕐 1 мес назад · релиз на GitHub ↗

vLLM Ascend v0.23.0: полная поддержка DeepSeek V4 на Ascend 950, новые модели и оптимизации графов.

  • Added: Добавлена полная поддержка DeepSeek V4 на Ascend 950, включая DSA attention, MTP и MXFP-квантование.
  • Added: Расширен список поддерживаемых моделей: GLM-5.2, Qwen3.5/3.6, Kimi-K3, Gemma4 и другие.
  • Added: Включен режим графов FULL_AND_PIECEWISE по умолчанию, улучшено асинхронное планирование и speculative execution.
  • Added: Улучшена работа с KV-cache: добавлена гибридная префиксная кэш-память и оффлоуд на CPU/SSD.
  • Added: Добавлена поддержка контекстной параллельности (Context Parallelism) и разреженного внимания для длинных контекстов.
v0.18.0major
🕐 4 мес назад · релиз на GitHub ↗

vLLM Ascend v0.18.0: поддержка новых моделей (Kimi-K2, Qwen3, GLM5), стабилизация EPLB и оптимизация NPU Graph.

  • Added: Добавлена экспериментальная поддержка моделей Kimi-K2.x, Minimax-m2.x, GLM5, Qwen3.x и DeepseekOCR.
  • Added: EPLB (балансировка нагрузки экспертного параллелизма) стала стабильнее и рекомендована к использованию.
  • Added: По умолчанию включен npugraph_ex с улучшенной оптимизацией графов и слиянием операций.
  • Added: Значительно улучшен KV Pooling (снижение TTFT), добавлена поддержка sparse attention и Mooncake connector.
  • Added: ACLGraph теперь поддерживает захват единого графа для multi-step drafts, снижая нагрузку на CPU.