Инструменты8 августа 2026 г., 21:45 МСК🤖 Auto

FireRedVAD: SOTA детекция голоса на 100+ языках с F1 97.57%

Команда FireRedTeam представила FireRedVAD — модель промышленного уровня для детекции речи и аудиособытий. Система превосходит Silero и WebRTC, поддерживая стриминг и 100+ языков при весе модели всего 2.2 МБ.

Баннер новости 5380

Новый стандарт точности: обгоняет лидеров рынка

Лаборатория FireRedTeam выпустила FireRedVAD — передовое решение для Voice Activity Detection (VAD) и Audio Event Detection (AED). Модель демонстрирует результаты уровня SOTA (State of the Art) на бенчмарке FLEURS-VAD-102, который охватывает 102 языка. В отличие от многих аналогов, система поддерживает как нестриминговую, так и стриминговую обработку аудио, а также классификацию событий: речь, пение и музыка.

Сравнение метрик: почему FireRedVAD лучше конкурентов

Ключевое преимущество FireRedVAD — баланс между обнаружением речи и минимизацией ложных срабатываний. В таблице ниже приведены результаты сравнения на тестовом наборе FLEURS-VAD-102 (9 443 аудиофайлов с ручной аннотацией). Обратите внимание на показатель False Alarm Rate (уровень ложных тревог): у FunASR-VAD он критически высок (44.03%), что делает его непригодным для точных задач, тогда как FireRedVAD держит этот показатель на уровне 2.69%.

Метрика FireRedVAD Silero-VAD TEN-VAD FunASR-VAD WebRTC-VAD
AUC-ROC (↑) 99.60 97.99 97.81
F1 score (↑) 97.57 95.95 95.19 90.91 52.30
False Alarm Rate (↓) 2.69 9.41 15.47 44.03 2.83
Miss Rate (↓) 3.62 3.95 2.95 0.42 64.15

Эффективность и архитектура

Несмотря на высокую точность, модель остается крайне легкой. Вес параметров для каждой задачи (VAD, Stream-VAD, AED) составляет всего 588 417 параметров (2.2 МБ в float32). Архитектура построена на базе DFSMN, что обеспечивает быструю инференс-скорость. Поддержка NCNN позволяет запускать модель на множестве платформ, включая мобильные устройства и edge-устройства.

Практическое применение и запуск

FireRedVAD доступна через PyPI и Hugging Face. Для работы требуется аудио в формате 16kHz 16-bit mono PCM. Система умеет возвращать не только бинарные метки, но и точные таймстампы событий, а также вероятности принадлежности к классам (речь/пение/музыка). Это делает её идеальной для предобработки аудио в ASR-системах, умных колонках и системах видеоконференций.

  • Установка: pip install fireredvad
  • Поддержка языков: 100+ языков (включая русский, английский, китайский и др.)
  • Формат вывода: JSON с таймстампами или TextGrid

Релиз включает полный код инференса, веса моделей и технический отчет, опубликованный на arXiv. Это решение закрывает потребность в легковесном, но точном инструменте для работы с голосом в мультиязычной среде.

Источник: Github ↗