Выпуск v0.6.18.post1 — корректирующая версия для FlashInfer без новых функций.
- Релиз v0.6.18.post1 является корректирующей версией, следующей за v0.6.18.
FlashInfer: Библиотека ядер для обслуживания LLM
FlashInfer — библиотека оптимизированных GPU-ядер для ускорения инференса LLM, обеспечивающая высокую производительность на различных архитектурах NVIDIA.
Инструмент решает задачу снижения задержек и увеличения пропускной способности при обслуживании больших языковых моделей. Он полезен тем, что автоматически выбирает оптимальные бэкенды (FlashAttention, cuDNN, TensorRT-LLM) и поддерживает сложные сценарии, такие как смешанное батчирование и квантование, что критично для production-развертывания.
👤 Кому подойдёт: ML-инженеры, разработчики LLM-сервисов и исследователи, занимающиеся оптимизацией инференса на GPU NVIDIA
Выпуск v0.6.18.post1 — корректирующая версия для FlashInfer без новых функций.
Релиз v0.6.18: оптимизации для B200/SM100, поддержка NVFP4/MxInt4 в MoE, фиксы FA2 и улучшенная документация.
Исправления для архитектуры Blackwell (SM107/Rubin), оптимизация сборки MoE и отключение низколатентных GEMM.
Релиз v0.6.17: поддержка FP4/FP8 MoE, оптимизация для SM100/SM120, интеграция MegaMoE и улучшение MLA.
В версии 0.6.16.post3 отменён бэкенд MoE для SM90 CUTLASS, ранее добавленный в #3738.
Выпущен релиз FlashInfer v0.6.16.post2 с исправлением совместимости ABI для зависимости tvm-ffi.
Выпуск FlashInfer 0.6.16.post1 содержит хотфикс TVM-FFI v0.1.13-post0 для исправления проблем с ABI-совместимостью.
Релиз v0.6.17rc1: поддержка FP8/FP4 MoE, оптимизации для SM100/SM120/SM121, интеграция MegaMoE и улучшение MLA.
Поддержка Blackwell RTX PRO/DGX Spark, переписанные GDN-ядра для Qwen3.5/3.6 и готовность к продакшену в vLLM.
Релиз v0.6.13: поддержка Blackwell (NVFP4, GQA), оптимизация MoE, ускорение FP8 и исправления автонастройки.