Выход MNN 3.6.1: новый Hexagon NPU бэкенд, полная поддержка C4 для LLM и значительный рост производительности на Android и macOS.
- Added: Добавлен новый бэкенд Hexagon NPU для прямого программирования DSP, обеспечивающий высокую скорость вывода Qwen3-0.6B на Snapdragon 8 Elite.
- Added: Полностью включен Transformer C4 граф на всех основных бэкендах (CPU, Metal, OpenCL, CUDA) с оптимизированными fused-операциями для LLM.
- Added: Внедрена поддержка MNN-aware QLoRA для эффективного дообучения моделей, а также добавлен инструмент профилирования Metal Op Profile.
- Fixed: Значительно улучшена производительность на Android (до +101.7% для prefill) и macOS Metal благодаря оптимизации kernel и исправлению кэширования.
- Fixed: Исправлены критические ошибки в LLM/VLM, включая корректность вывода Qwen3.5, проблемы с KVCache при推测解码 и стабильность mmap.