openai/whisper

Устойчивое распознавание речи через слабый контроль на больших данных

Аудио⭐ 109 413Pythonпоследний релиз: v20250625
Открыть на GitHub ↗

Что это за инструмент

Whisper — это модель распознавания речи от OpenAI, способная транскрибировать аудио, переводить речь и определять язык.

Зачем нужен

Инструмент решает задачу преобразования устной речи в текст на множестве языков, а также выполняет перевод и идентификацию языка. Он полезен тем, что заменяет многоэтапные пайплайны обработки речи единой моделью, обученной на больших данных с использованием слабой разметки.

Что можно реализовать

  • Автоматическая транскрибация аудиофайлов (mp3, wav, flac) в текст
  • Перевод речи с других языков на английский
  • Определение языка, на котором ведется речь в аудио
  • Выделение голосовых сегментов (voice activity detection)
  • Быстрая обработка аудио на слабых устройствах с использованием легких моделей (tiny, base)

Ключевые возможности

  • Мультизадачность: распознавание, перевод и идентификация языка в одной модели
  • 6 размеров моделей (от tiny до large) и оптимизированная версия turbo для баланса скорости и точности
  • Поддержка множества языков благодаря обучению на разнообразных данных
  • Простая установка через pip и использование через командную строку
  • Наличие английских версий моделей (.en) для повышения точности на английском языке

👤 Кому подойдёт: разработчики, исследователи, аналитики данных, работающие с аудио- и видеоконтентом

Релизы