SYSTRAN/faster-whisper

Быстрая транскрипция Whisper с использованием CTranslate2

Аудио⭐ 25 719Pythonпоследний релиз: v1.2.1
Открыть на GitHub ↗

Что это за инструмент

faster-whisper — это высокопроизводительная реализация модели OpenAI Whisper, использующая движок CTranslate2 для ускорения транскрипции аудио.

Зачем нужен

Инструмент решает задачу быстрой и экономичной конвертации речи в текст, работая в 4 раза быстрее оригинального Whisper при той же точности. Он оптимизирован для снижения потребления памяти и поддерживает квантование моделей.

Что можно реализовать

  • Локальная обработка аудиофайлов на серверах с GPU (NVIDIA) или CPU
  • Пакетная транскрипция больших объемов аудио с использованием batch_size > 1
  • Развертывание сервисов распознавания речи в условиях ограниченных ресурсов (VRAM/RAM)
  • Интеграция в пайплайны обработки данных, требующие низкой задержки

Ключевые возможности

  • До 4x быстрее оригинального openai/whisper при сопоставимой точности
  • Поддержка 8-bit квантования (int8) для снижения потребления памяти и ускорения работы
  • Встроенная декодировка аудио через PyAV (не требует установки FFmpeg в систему)
  • Гибкая настройка параметров: device (CPU/GPU), precision (fp16/int8), beam_size, batch_size
  • Поддержка современных моделей, включая distil-whisper-large-v3

👤 Кому подойдёт: Разработчики ML, инженеры по данным, DevOps-инженеры, работающие с аудио-пайплайнами и оптимизацией инференса LLM/Transformer-моделей.

Релизы

v1.2.1minor
🕐 11 мес назад · релиз на GitHub ↗

Обновление Silero-VAD до версии 6, исправления для пакетного вывода и улучшенная логика повторных попыток.

  • Added: Обновлён модуль шумоподавления Silero-VAD до версии 6.
  • Fixed: Исправлена ошибка, приводившая к появлению токенов <|nocaptions|> в пакетном режиме.
  • Fixed: Улучшена обработка клиповых меток времени в пакетном выводе.
  • Added: Логика повторных попыток при ошибках перенесена в Hugging Face Hub.
  • Fixed: Исправлена логика слияния результатов, если клиповые метки не заданы.