Релиз модели20 июля 2026 г., 15:46 МСК🤖 Auto

MobileWan: Оптимизация Wan2.2-5B для мобильных устройств

Qualcomm AI Research представила MobileWan — облегченную версию видео-диффузионной модели Wan2.2-5B, адаптированную для работы на мобильных устройствах с сохранением высокого качества генерации.

Баннер новости 3952

Суть проекта: от 5B к мобильному формату

Лаборатория Qualcomm AI Research выпустила репозиторий MobileWan, который представляет собой инференс-сэмплер для легкой версии модели Wan2.2-5B. Основная цель проекта — закрыть разрыв в качестве между десктопными и мобильными видео-генераторами. Для этого использовались методы хирургии внимания (hybrid-attention surgery), прунинг (обрезка) голов самовнимания и внедрение специфических эмбеддингов.

Релиз сфокусирован на генерации видео по одному промпту. Код включает в себя план прунинга и логику модификации архитектуры, что позволяет загрузить оптимизированные веса трансформера непосредственно на устройстве пользователя.

Технические характеристики и метрики

Модель использует специфический подход к дистилляции: выпущенный чекпоинт соответствует 3-шаговой декуплированной модели DMD (Decoupled Mixture of Distilled). Оценка качества проводилась через бенчмарк VBench, который показал результат 82.44 (Total Score). Это достигается при использовании сэмплера flow_euler с параметром shift и промптами, улучшенными через GPT.

Ключевые параметры генерации зафиксированы в коде (mobilewan/config.py) и не выставляются через CLI:

Параметр Значение Примечание
Разрешение (H x W) 480 x 832 Стандартное соотношение сторон для мобильных экранов
Количество кадров 81 Длительность видео при стандартном FPS
CFG Scale 1.0 Отключена классическая CFG-дистилляция в пользу других методов
Базовая модель Wan2.2-TI2V-5B-Diffusers Используется как pre-trained основа

Требования к окружению и установка

Проект требует современного стека технологий для обеспечения совместимости с актуальными оптимизациями PyTorch. Основные требования:

  • Python: >= 3.10.12
  • PyTorch: >= 2.5.1
  • Diffusers: >= 0.36.0
  • Transformers: 4.49.0 – 4.51.3

Для удобства развертывания подготовлен Dockerfile. Пользователи могут собрать образ локально или использовать GPU-версию через NVIDIA Container Toolkit. Чекпоинты модели загружаются с Hugging Face через команду huggingface-cli download Qualcomm-AI-Research/mobilewan.

Почему это важно

MobileWan демонстрирует, что сложные видео-модели с миллиардами параметров могут быть успешно адаптированы для мобильных устройств без критической потери качества. Использование гибридного внимания и прунинга позволяет снизить вычислительную нагрузку, делая генерацию видео доступной вне облачных серверов. Это важный шаг к децентрализованному AI-контенту на смартфонах и планшетах.

Источник: Github ↗