Суть проекта: от 5B к мобильному формату
Лаборатория Qualcomm AI Research выпустила репозиторий MobileWan, который представляет собой инференс-сэмплер для легкой версии модели Wan2.2-5B. Основная цель проекта — закрыть разрыв в качестве между десктопными и мобильными видео-генераторами. Для этого использовались методы хирургии внимания (hybrid-attention surgery), прунинг (обрезка) голов самовнимания и внедрение специфических эмбеддингов.
Релиз сфокусирован на генерации видео по одному промпту. Код включает в себя план прунинга и логику модификации архитектуры, что позволяет загрузить оптимизированные веса трансформера непосредственно на устройстве пользователя.
Технические характеристики и метрики
Модель использует специфический подход к дистилляции: выпущенный чекпоинт соответствует 3-шаговой декуплированной модели DMD (Decoupled Mixture of Distilled). Оценка качества проводилась через бенчмарк VBench, который показал результат 82.44 (Total Score). Это достигается при использовании сэмплера flow_euler с параметром shift и промптами, улучшенными через GPT.
Ключевые параметры генерации зафиксированы в коде (mobilewan/config.py) и не выставляются через CLI:
| Параметр | Значение | Примечание |
|---|---|---|
| Разрешение (H x W) | 480 x 832 | Стандартное соотношение сторон для мобильных экранов |
| Количество кадров | 81 | Длительность видео при стандартном FPS |
| CFG Scale | 1.0 | Отключена классическая CFG-дистилляция в пользу других методов |
| Базовая модель | Wan2.2-TI2V-5B-Diffusers | Используется как pre-trained основа |
Требования к окружению и установка
Проект требует современного стека технологий для обеспечения совместимости с актуальными оптимизациями PyTorch. Основные требования:
- Python: >= 3.10.12
- PyTorch: >= 2.5.1
- Diffusers: >= 0.36.0
- Transformers: 4.49.0 – 4.51.3
Для удобства развертывания подготовлен Dockerfile. Пользователи могут собрать образ локально или использовать GPU-версию через NVIDIA Container Toolkit. Чекпоинты модели загружаются с Hugging Face через команду huggingface-cli download Qualcomm-AI-Research/mobilewan.
Почему это важно
MobileWan демонстрирует, что сложные видео-модели с миллиардами параметров могут быть успешно адаптированы для мобильных устройств без критической потери качества. Использование гибридного внимания и прунинга позволяет снизить вычислительную нагрузку, делая генерацию видео доступной вне облачных серверов. Это важный шаг к децентрализованному AI-контенту на смартфонах и планшетах.
Источник: Github ↗
