Суть прорыва: скорость и компактность
Команда Microsoft выпустила VibeASR.cpp — официальный рантайм для модели VibeVoice-ASR-BitNet. Главная цель проекта — обеспечить реальное время распознавания речи (Real-Time Factor < 1) на обычных процессорах без использования GPU. Ключевое отличие от аналогов (например, Whisper.cpp) — использование гетерогенного квантования: VAE-токенизатор сжат до формата I8_S, а языковая модель (LM) — до I2_S.
Для оптимизации разработчики заменили базовую Qwen2.5-7B на более легкую Qwen2.5-1.5B. Это позволило сократить общий размер модели с 4.62 ГБ до 1.58 ГБ, потеряв лишь 1–4% в точности (WER), но выиграв в скорости за счет кастомных SIMD-ядер и слияния операторов в фреймворке ggml.
Сравнение размеров и сжатия
Техника квантования позволила существенно уменьшить вес компонентов модели. Ниже приведено сравнение размеров оригинальной модели (FP16) и оптимизированной версии BitNet:
| Компонент | VibeVoice-ASR-1.5B (FP16) | VibeVoice-ASR-BitNet | Коэффициент сжатия |
|---|---|---|---|
| VAE Tokenizer | 1.31 GB | 0.65 GB | 2.0× |
| LM Decoder | 3.32 GB | 0.92 GB | 3.6× |
| Итого | 4.62 GB | 1.58 GB | 2.9× |
Производительность на разных архитектурах
Тестирование показало, что VibeVoice-ASR-BitNet стабильно обходит Whisper.cpp по скорости вывода (RTF). На серверных процессорах AMD EPYC 7V13 и мобильных чипах Apple M4 модель демонстрирует способность обрабатывать аудио быстрее, чем оно записывается (RTF < 1), что критично для edge-устройств.
| Платформа | RTF (Real-Time Factor) | Ускорение vs Whisper.cpp |
|---|---|---|
| AMD EPYC 7V13 (24C) | от 0.42 до 1.98 | до 2.28× |
| Apple M4 (ARM NEON) | от 0.42 до 1.18 | данные недостаточны для прямого сравнения в таблице, но заявлено преимущество |
| Intel Core i7-13700 | от 0.67 до 1.55 | данные недостаточны для прямого сравнения в таблице, но заявлено преимущество |
Примечание: RTF < 1 означает реальное время обработки. Тесты проводились на аудиофрагментах от 10 до 20 секунд.
Точность распознавания (WER)
Несмотря на агрессивное сжатие, модель сохраняет высокую точность на стандартных датасетах. В сравнении с другими open-source решениями (Whisper, SenseVoice, FunASR), VibeVoice-ASR-BitNet показывает конкурентные результаты, особенно на чистом английском и китайском языках.
| Датасет | VibeVoice-ASR-BitNet (WER %) | Whisper (WER %) | SenseVoice (WER %) |
|---|---|---|---|
| Libri-clean | 1.58 | 2.41 | 1.49 |
| Fleurs-en | 4.93 | 5.21 | 4.09 |
| Libri-other | 4.01 | 6.27 | 3.13 |
| MLC-EN | 11.36 | 12.39 | 8.40 |
Как запустить
Проект поддерживает установку в один клик через pip, но требует компиляции из исходников. Важно: на Windows не поддерживается MSVC, требуется GCC/Clang (рекомендуется MinGW-w64). Модель доступна на HuggingFace в квантованном виде.
- Клонирование:
git clone --recursive https://github.com/microsoft/VibeASR.cpp.git - Установка:
pip install -r requirements.txtиpython setup_env.py - Запуск демо:
python demo/gradio_asr_demo.py --port 7860
Лицензия проекта — MIT. Технический отчет доступен на arXiv (arXiv:2607.21075).
Источник: Github ↗
