vLLM-Omni v0.28.0: новый Host Weight Runtime, планировщик KV-кэша для диффузии, полнодуплексный голос и поддержка MiniMax H3.
- Added: Внедрен Host Weight Runtime для управления весами через mmap, включая распределенный offload без AllGather.
- Added: Добавлен управляемый планировщиком paged KV cache для диффузии, поддерживающий HunyuanImage3 на GPU и NPU.
- Added: Расширен стек полнодуплексного голоса: добавлены PersonaPlex, NVIDIA Nemotron VoiceChat и улучшения MiniCPM-o.
- Added: Значительно улучшена поддержка MiniMax H3: добавлены непрерывное батчинг, FP8/INT8 пути и оптимизации для NPU/ROCm.
- Added: Добавлена поддержка моделей PersonaPlex, NVIDIA Nemotron VoiceChat, MiniMax Music 3, LTX-2.5 и других.