Новый стандарт точности: обгоняет лидеров рынка
Лаборатория FireRedTeam выпустила FireRedVAD — передовое решение для Voice Activity Detection (VAD) и Audio Event Detection (AED). Модель демонстрирует результаты уровня SOTA (State of the Art) на бенчмарке FLEURS-VAD-102, который охватывает 102 языка. В отличие от многих аналогов, система поддерживает как нестриминговую, так и стриминговую обработку аудио, а также классификацию событий: речь, пение и музыка.
Сравнение метрик: почему FireRedVAD лучше конкурентов
Ключевое преимущество FireRedVAD — баланс между обнаружением речи и минимизацией ложных срабатываний. В таблице ниже приведены результаты сравнения на тестовом наборе FLEURS-VAD-102 (9 443 аудиофайлов с ручной аннотацией). Обратите внимание на показатель False Alarm Rate (уровень ложных тревог): у FunASR-VAD он критически высок (44.03%), что делает его непригодным для точных задач, тогда как FireRedVAD держит этот показатель на уровне 2.69%.
| Метрика | FireRedVAD | Silero-VAD | TEN-VAD | FunASR-VAD | WebRTC-VAD |
|---|---|---|---|---|---|
| AUC-ROC (↑) | 99.60 | 97.99 | 97.81 | — | — |
| F1 score (↑) | 97.57 | 95.95 | 95.19 | 90.91 | 52.30 |
| False Alarm Rate (↓) | 2.69 | 9.41 | 15.47 | 44.03 | 2.83 |
| Miss Rate (↓) | 3.62 | 3.95 | 2.95 | 0.42 | 64.15 |
Эффективность и архитектура
Несмотря на высокую точность, модель остается крайне легкой. Вес параметров для каждой задачи (VAD, Stream-VAD, AED) составляет всего 588 417 параметров (2.2 МБ в float32). Архитектура построена на базе DFSMN, что обеспечивает быструю инференс-скорость. Поддержка NCNN позволяет запускать модель на множестве платформ, включая мобильные устройства и edge-устройства.
Практическое применение и запуск
FireRedVAD доступна через PyPI и Hugging Face. Для работы требуется аудио в формате 16kHz 16-bit mono PCM. Система умеет возвращать не только бинарные метки, но и точные таймстампы событий, а также вероятности принадлежности к классам (речь/пение/музыка). Это делает её идеальной для предобработки аудио в ASR-системах, умных колонках и системах видеоконференций.
- Установка:
pip install fireredvad - Поддержка языков: 100+ языков (включая русский, английский, китайский и др.)
- Формат вывода: JSON с таймстампами или TextGrid
Релиз включает полный код инференса, веса моделей и технический отчет, опубликованный на arXiv. Это решение закрывает потребность в легковесном, но точном инструменте для работы с голосом в мультиязычной среде.
Источник: Github ↗
