vllm-project/vllm-omni

Фреймворк для эффективного инференса омни-модальных моделей

Инференс⭐ 6 948Pythonпоследний релиз: v0.28.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

vLLM-Omni — это фреймворк для эффективного развертывания и инференса мультимодальных моделей (omni-modality), расширяющий возможности vLLM за пределы текстовых LLM.

Зачем нужен

Инструмент решает задачу обслуживания сложных моделей, генерирующих не только текст, но и аудио, изображения, видео и действия (actions). Он полезен для снижения задержек и повышения пропускной способности за счет оптимизации работы с KV-кэшем, конвейерного выполнения этапов и поддержки неавтогенеративных архитектур.

Что можно реализовать

  • Развертывание TTS-моделей (например, Qwen3-TTS, CosyVoice3) для генерации речи в реальном времени.
  • Создание сервисов генерации изображений и видео на базе Diffusion Transformers (DiT), таких как Cosmos3 или HunyuanImage.
  • Построение end-to-end omni-агентов, обрабатывающих и генерирующих текст, звук и визуальные данные одновременно (например, Qwen3-Omni).
  • Интеграция RL-фреймворков (VeRL-Omni) для обучения и инференса моделей с учетом действий (robot-policy serving).

Ключевые возможности

  • Поддержка неавтогенеративных архитектур, включая Diffusion Transformers (DiT) и параллельную генерацию.
  • Гибридная оптимизация: использование эффективного управления KV-кэшем от vLLM для AR-частей и конвейерное выполнение для других этапов.
  • Полная совместимость с OpenAI-compatible API сервером и интеграция с Hugging Face моделями.
  • Поддержка широкого спектра аппаратных бэкендов: CUDA, ROCm, MUSA, NPU и XPU.
  • Возможность дисагрегации (disaggregation) сервисов и динамического распределения ресурсов между этапами обработки.

👤 Кому подойдёт: ML-инженеры, разработчики AI-платформ и исследователи, работающие с мультимодальными моделями и нуждающиеся в высокопроизводительном инференсе.

Релизы

v0.28.0major
🕐 20 дн назад · релиз на GitHub ↗

vLLM-Omni v0.28.0: новый Host Weight Runtime, планировщик KV-кэша для диффузии, полнодуплексный голос и поддержка MiniMax H3.

  • Added: Внедрен Host Weight Runtime для управления весами через mmap, включая распределенный offload без AllGather.
  • Added: Добавлен управляемый планировщиком paged KV cache для диффузии, поддерживающий HunyuanImage3 на GPU и NPU.
  • Added: Расширен стек полнодуплексного голоса: добавлены PersonaPlex, NVIDIA Nemotron VoiceChat и улучшения MiniCPM-o.
  • Added: Значительно улучшена поддержка MiniMax H3: добавлены непрерывное батчинг, FP8/INT8 пути и оптимизации для NPU/ROCm.
  • Added: Добавлена поддержка моделей PersonaPlex, NVIDIA Nemotron VoiceChat, MiniMax Music 3, LTX-2.5 и других.
v0.26.0major
🕐 1 мес назад · релиз на GitHub ↗

vLLM-Omni v0.26.0: поддержка MiniMax H3, экспериментальный full-duplex runtime для MiniCPM-o 4.5 и распределенное offload-диффузионное моделирование.

  • Added: Добавлена поддержка совместной генерации видео и аудио через модель MiniMax H3 (T2VA, FL2VA, Ref2VA) с поддержкой NPU и ROCm.
  • Added: Внедрен экспериментальный full-duplex runtime для MiniCPM-o 4.5 с поддержкой WebSocket, потокового ввода/вывода и обработки barge-in.
  • Added: Реализовано распределенное послойное offload для диффузионных моделей с mmap-загрузкой весов и DP-мультиконкурентностью, что резко снизило потребление памяти.
  • Added: Проект переоснован на vLLM 0.26.0, добавлена экспериментальная поддержка composable parallel strategy overlays через strategy.yaml.
  • Added: Расширен список поддерживаемых моделей: Krea 2, OmniGen2, Cosmos3, LingBot Video, MammothModa2-Dev, Boogu Image 0.1, Nemotron Audex, MOSS-TTS-Local v1.5.