ZhiLight v0.4.8: асинхронный интерфейс OpenAI, оптимизации через SIMD и Tensor Core, поддержка MoE, FlashAttention и квантования.
- Added: Асинхронный интерфейс, совместимый с OpenAI, адаптированный из vllm.
- Added: Оптимизация производительности: наложение encode и all-reduce (dual streams), SIMD-инструкции для host all-reduce.
- Added: Fused batch attention для декодирования на базе инструкций Tensor Core.
- Added: Поддержка MoE, DeepSeek-V2 MoE и DeepSeek-V2 MLA.
- Added: Поддержка квантования INT8, SmoothQuant, FP8, AWQ, GPTQ и ядра Marlin для GPTQ.
- Added: Поддержка FlashAttention, chunked prefill, prefix cache и динамического батча.