PaddlePaddle/FastDeploy

Высокопроизводительный инструмент для инференса и деплоя LLM и VLM на базе PaddlePaddle

Инференс⭐ 3 716Pythonпоследний релиз: v2.5.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

FastDeploy — это высокопроизводительный инструмент для инференса и развертывания LLM и VLM на базе фреймворка PaddlePaddle.

Зачем нужен

Инструмент решает задачу создания production-ready решений для запуска больших языковых и мультимодальных моделей, обеспечивая высокую пропускную способность и низкую задержку. Он полезен для оптимизации ресурсов за счет передовых техник, таких как PD-разделение, KV-кэширование и различные форматы квантования, а также для обеспечения совместимости с экосистемой vLLM.

Что можно реализовать

  • Развертывание LLM/VLM на NVIDIA GPU, а также на отечественных и специализированных чипах (Kunlunxin, Hygon DCU, Iluvatar, Enflame, Metax, Intel Gaudi)
  • Организация балансировки нагрузки с использованием PD-разделения (Prefill-Decode) и динамического переключения ролей инстансов
  • Запуск моделей с поддержкой MTP (Multi-Token Prediction) и спекулятивного декодирования для ускорения генерации
  • Использование моделей из HuggingFace и применение квантования (W4A8, W8A16, FP8 и др.) для снижения требований к памяти
  • Предоставление API-сервиса, совместимого с интерфейсом OpenAI и vLLM, для интеграции в существующие приложения

Ключевые возможности

  • Поддержка широкого спектра аппаратных платформ, включая NVIDIA GPU и множество китайских аналогов (Kunlunxin, Hygon, Iluvatar и др.)
  • Продвинутые механизмы оптимизации: PD-разделение, глобальный пул кэширования, префиксное кэширование и чанковое префиллинг
  • Полная поддержка форматов квантования: W8A16, W8A8, W4A16, W4A8, W2A16, FP8
  • Совместимость с vLLM API и поддержка моделей из HuggingFace
  • Активная разработка с регулярными обновлениями (v2.5) и поддержкой новейших архитектур (Qwen3-VL, DeepSeek V3, ERNIE-4.5)

👤 Кому подойдёт: Инженеры по машинному обучению (MLE), разработчики MLOps и исследователи, работающие с LLM/VLM, особенно те, кто использует PaddlePaddle или нуждается в развертывании на специфичных аппаратных платформах.

Релизы

v2.5.0major
🕐 5 мес назад · релиз на GitHub ↗

FastDeploy v2.5: поддержка Qwen3-VL, MoE, PD-сегрегации, KV Cache и оптимизации для XPU/Blackwell.

  • Added: Добавлена поддержка моделей Qwen3-VL, Qwen3-VL MoE и GLM с TP+DP+EP.
  • Added: Реализована сегрегация префилла и декодирования (PD Disaggregation) с RDMA и динамическим C8.
  • Added: Внедрены новые методы квантования: W4AFp8, NVFP4 MoE для SM100 и FusedMoE для Blackwell.
  • Added: Добавлена поддержка KV Cache бэкендов (attention_store, file_store) и RL-интерфейсов.
  • Added: Расширена поддержка XPU: CUDA Graph, Speculative Decoding, EP+MTP и оптимизация производительности.