m-bain/whisperX

WhisperX: Automatic Speech Recognition with Word-level Timestamps (& Diarization)

Аудио⭐ 24 156Pythonпоследний релиз: v3.8.6
Открыть на GitHub ↗

Что это за инструмент

WhisperX — это инструмент автоматического распознавания речи (ASR), который значительно повышает точность таймкодов до уровня отдельных слов и добавляет функцию разделения говорящих (diarization).

Зачем нужен

Инструмент решает проблему неточных таймкодов в стандартном Whisper, используя форсированное выравнивание на основе wav2vec2, и позволяет идентифицировать разных спикеров в аудио. Это полезно для создания качественных субтитров, аннотирования данных и анализа многопользовательских аудиозаписей.

Что можно реализовать

  • Создание точных субтитров для видео с привязкой к конкретным словам
  • Анализ записей совещаний или интервью с определением, кто именно говорит
  • Быстрая транскрипция длинных аудиофайлов (до 70x real-time)
  • Обучение моделей ASR на размеченных данных с точными границами слов

Ключевые возможности

  • Высокоскоростное выполнение: до 70x real-time благодаря бэкенду faster-whisper
  • Точные таймкоды на уровне слов (word-level timestamps) через wav2vec2 alignment
  • Автоматическое определение спикеров (speaker diarization) с использованием pyannote-audio
  • Использование Voice Activity Detection (VAD) для снижения галлюцинаций модели
  • Низкое потребление GPU-памяти (<8GB для large-v2) и поддержка батчинга

👤 Кому подойдёт: разработчики, исследователи в области NLP, инженеры данных, создающие системы автоматической транскрипции и анализа аудио

Релизы

v3.8.6patch
🕐 3 мес назад · релиз на GitHub ↗

Добавлена поддержка индонезийской модели, исправлена обработка интерполяции NaN и обновлены зависимости.

  • Added: Добавлена индонезийская модель в alignment.py.
  • Fixed: Исправлена обработка метода интерполяции 'ignore' в interpolate_nans.
  • Added: Обновлена зависимость nltk с версии 3.9.2 до 3.9.4.
  • Added: Доработаны CI-воркфлоу: добавлен zizmor и усилены существующие проверки.