Инструменты2 августа 2026 г., 15:45 МСК🤖 Auto

Microsoft выпустила VibeVoice-ASR-BitNet: быстрый ASR для CPU

Microsoft представила VibeVoice-ASR-BitNet — рантайм для распознавания речи на CPU, который работает в 1.6–2.3 раза быстрее Whisper.cpp при размере модели всего 1.58 ГБ.

Баннер новости 4904

Суть прорыва: скорость и компактность

Команда Microsoft выпустила VibeASR.cpp — официальный рантайм для модели VibeVoice-ASR-BitNet. Главная цель проекта — обеспечить реальное время распознавания речи (Real-Time Factor < 1) на обычных процессорах без использования GPU. Ключевое отличие от аналогов (например, Whisper.cpp) — использование гетерогенного квантования: VAE-токенизатор сжат до формата I8_S, а языковая модель (LM) — до I2_S.

Для оптимизации разработчики заменили базовую Qwen2.5-7B на более легкую Qwen2.5-1.5B. Это позволило сократить общий размер модели с 4.62 ГБ до 1.58 ГБ, потеряв лишь 1–4% в точности (WER), но выиграв в скорости за счет кастомных SIMD-ядер и слияния операторов в фреймворке ggml.

Сравнение размеров и сжатия

Техника квантования позволила существенно уменьшить вес компонентов модели. Ниже приведено сравнение размеров оригинальной модели (FP16) и оптимизированной версии BitNet:

Компонент VibeVoice-ASR-1.5B (FP16) VibeVoice-ASR-BitNet Коэффициент сжатия
VAE Tokenizer 1.31 GB 0.65 GB 2.0×
LM Decoder 3.32 GB 0.92 GB 3.6×
Итого 4.62 GB 1.58 GB 2.9×

Производительность на разных архитектурах

Тестирование показало, что VibeVoice-ASR-BitNet стабильно обходит Whisper.cpp по скорости вывода (RTF). На серверных процессорах AMD EPYC 7V13 и мобильных чипах Apple M4 модель демонстрирует способность обрабатывать аудио быстрее, чем оно записывается (RTF < 1), что критично для edge-устройств.

Платформа RTF (Real-Time Factor) Ускорение vs Whisper.cpp
AMD EPYC 7V13 (24C) от 0.42 до 1.98 до 2.28×
Apple M4 (ARM NEON) от 0.42 до 1.18 данные недостаточны для прямого сравнения в таблице, но заявлено преимущество
Intel Core i7-13700 от 0.67 до 1.55 данные недостаточны для прямого сравнения в таблице, но заявлено преимущество

Примечание: RTF < 1 означает реальное время обработки. Тесты проводились на аудиофрагментах от 10 до 20 секунд.

Точность распознавания (WER)

Несмотря на агрессивное сжатие, модель сохраняет высокую точность на стандартных датасетах. В сравнении с другими open-source решениями (Whisper, SenseVoice, FunASR), VibeVoice-ASR-BitNet показывает конкурентные результаты, особенно на чистом английском и китайском языках.

Датасет VibeVoice-ASR-BitNet (WER %) Whisper (WER %) SenseVoice (WER %)
Libri-clean 1.58 2.41 1.49
Fleurs-en 4.93 5.21 4.09
Libri-other 4.01 6.27 3.13
MLC-EN 11.36 12.39 8.40

Как запустить

Проект поддерживает установку в один клик через pip, но требует компиляции из исходников. Важно: на Windows не поддерживается MSVC, требуется GCC/Clang (рекомендуется MinGW-w64). Модель доступна на HuggingFace в квантованном виде.

  • Клонирование: git clone --recursive https://github.com/microsoft/VibeASR.cpp.git
  • Установка: pip install -r requirements.txt и python setup_env.py
  • Запуск демо: python demo/gradio_asr_demo.py --port 7860

Лицензия проекта — MIT. Технический отчет доступен на arXiv (arXiv:2607.21075).

Источник: Github ↗