Softcatala/whisper-ctranslate2

Командная строка Whisper, совместимая с оригинальным клиентом OpenAI, на базе CTranslate2.

Инференс⭐ 1 350Pythonпоследний релиз: 0.5.7
Открыть на GitHub ↗

Что это за инструмент

whisper-ctranslate2 — это оптимизированная реализация Whisper на базе CTranslate2, совместимая с оригинальным CLI OpenAI, обеспечивающая до 4-кратного ускорения при меньшей нагрузке на память.

Зачем нужен

Инструмент решает задачу быстрой и ресурсоэффективной транскрипции и перевода аудиофайлов, заменяя медленный оригинальный OpenAI Whisper. Он полезен для разработчиков и инженеров, которым нужно интегрировать распознавание речи в свои пайплайны с минимальными изменениями в коде или командах.

Что можно реализовать

  • Локальная транскрипция аудиофайлов с сохранением субтитров или текста без отправки данных в облако.
  • Автоматический перевод аудио на английский язык с использованием встроенной задачи translate.
  • Обработка больших объемов аудио с помощью батчинга (batched inference) для максимального ускорения.
  • Фильтрация тишины из аудио перед обработкой для повышения качества и скорости через VAD-фильтр.
  • Запуск транскрипции в изолированной среде с помощью готового Docker-образа с предзагруженными моделями.

Ключевые возможности

  • Совместимость с оригинальным CLI OpenAI Whisper (легкая миграция).
  • Поддержка GPU (NVIDIA cuBLAS) и оптимизированных CPU-бэкендов (Intel MKL, oneDNN, Apple Accelerate).
  • Встроенная поддержка Speaker Diarization (разделение говорящих) и VAD-фильтра.
  • Возможность загрузки собственных fine-tuned моделей в формате CTranslate2.
  • Визуализация уверенности модели с помощью цветовой кодировки в консоли.

👤 Кому подойдёт: разработчики, инженеры ML, DevOps-инженеры, исследователи, работающие с аудио-данными локально

Релизы