alibaba/MNN

MNN: молниеносный, легкий движок вывода, проверенный в боях Alibaba, обеспечивающий высокопроизводительные on-device LLM и Edge AI.

Инференс⭐ 16 120C++последний релиз: 3.6.1
Открыть на GitHub ↗

Что это за инструмент

MNN — это легковесный движок инференса и обучения нейросетей от Alibaba, оптимизированный для работы на мобильных устройствах, IoT и edge-устройствах.

Зачем нужен

Инструмент позволяет запускать сложные модели (LLM, diffusion, CV) локально на устройствах с ограниченными ресурсами, обеспечивая высокую скорость и низкое энергопотребление. Он полезен для разработчиков, которым нужно интегрировать AI-функционал в приложения без зависимости от облачных серверов, сохраняя приватность данных и работоспособность офлайн.

Что можно реализовать

  • Запуск локальных LLM (Qwen, LLaMA, DeepSeek) на Android/iOS устройствах через MNN-LLM.
  • Генерация и редактирование изображений (stable diffusion, Sana) прямо на смартфоне через MNN-Diffusion.
  • Создание интерактивных 3D-аватаров с голосовым и текстовым взаимодействием (MNN TaoAvatar).
  • Интеграция компьютерного зрения в мобильные приложения (поиск по фото, AR, видеостримы).
  • Разработка IoT-решений с AI-инференсом на встроенных устройствах.

Ключевые возможности

  • Высокая производительность инференса и обучения на edge-устройствах (мобильные, IoT).
  • Поддержка широкого спектра моделей: LLM (Qwen3.5, Qwen3, DeepSeek), diffusion (Sana, Stable Diffusion) и мультимодальных моделей.
  • Готовые приложения-примеры: MNN Chat (текст/аудио/изображение), MNN TaoAvatar (3D-аватары), Sana-Edit (редактирование фото).
  • Промышленная надежность: используется в более чем 30 приложениях Alibaba (Taobao, DingTalk, Youku и др.).
  • Кроссплатформенность: поддержка Android, iOS, PC и embedded-устройств.

👤 Кому подойдёт: Мобильные разработчики, инженеры по машинному обучению (ML engineers), разработчики IoT-устройств, создатели приложений с AI-функционалом.

Релизы

3.6.1minor
🕐 2 мес назад · релиз на GitHub ↗

Выход MNN 3.6.1: новый Hexagon NPU бэкенд, полная поддержка C4 для LLM и значительный рост производительности на Android и macOS.

  • Added: Добавлен новый бэкенд Hexagon NPU для прямого программирования DSP, обеспечивающий высокую скорость вывода Qwen3-0.6B на Snapdragon 8 Elite.
  • Added: Полностью включен Transformer C4 граф на всех основных бэкендах (CPU, Metal, OpenCL, CUDA) с оптимизированными fused-операциями для LLM.
  • Added: Внедрена поддержка MNN-aware QLoRA для эффективного дообучения моделей, а также добавлен инструмент профилирования Metal Op Profile.
  • Fixed: Значительно улучшена производительность на Android (до +101.7% для prefill) и macOS Metal благодаря оптимизации kernel и исправлению кэширования.
  • Fixed: Исправлены критические ошибки в LLM/VLM, включая корректность вывода Qwen3.5, проблемы с KVCache при推测解码 и стабильность mmap.
3.6.0major
🕐 3 мес назад · релиз на GitHub ↗

MNN 3.6.0: поддержка Gemma4, Qwen3.5, Wan2.1-T2V, dflash, 2/3-bit квантование и оптимизация GPU/CPU.

  • Added: Добавлена полная поддержка мультимодальных моделей Gemma4 (текст, зрение, аудио) и видеогенерации Wan2.1-T2V-1.3B.
  • Added: Внедрено推测解码 dflash и оптимизация交错 генерации Omni (TTFA снижена в 2.7 раза).
  • Added: Реализована полная поддержка 2/3-bit весового квантования для CPU (ARM) и GPU (OpenCL/Metal/Vulkan).
  • Added: GPU-бэкенды: поддержка CUDA Blackwell (sm_120), Vulkan W8A8 coopMat, оптимизация Qwen3.5 и QNN.
  • Added: CPU-бэкенд: ускорение ARM v8.2/v8.6, добавлены RVV-оптимизации и fused-ядро MNNFusedGatedDelta.
  • Fixed: Исправлены утечки памяти, ошибки кэширования KV, проблемы экспорта Gemma4/Qwen3-VL и стабильность LinearAttention.