collabora/WhisperLive

Почти реальное время реализации OpenAI's Whisper.

Аудио⭐ 4 288Pythonпоследний релиз: v0.10.0
Открыть на GitHub ↗

Что это за инструмент

WhisperLive — это инструмент для транскрипции речи в текст в реальном времени (почти live), использующий модели OpenAI Whisper.

Зачем нужен

Инструмент преобразует аудиопоток с микрофона или аудиофайлы в текст с минимальной задержкой. Он полезен для создания систем субтитров, голосовых помощников и автоматической обработки аудио-контента, предоставляя серверную архитектуру с поддержкой различных бэкендов.

Что можно реализовать

  • Генерация субтитров для прямых трансляций или видеозвонков
  • Автоматическая транскрипция записей совещаний и лекций
  • Интеграция голосового ввода в веб-приложения через REST API
  • Обработка аудиофайлов с возможностью выделения слов по таймстампам
  • Разделение говорящих (diarization) в многопользовательских аудиопотоках

Ключевые возможности

  • Поддержка нескольких бэкендов: faster_whisper, TensorRT (для NVIDIA GPU) и OpenVINO (для Intel CPU/iGPU/dGPU)
  • Работа в режиме реального времени с микрофона или через REST API (совместимо с OpenAI REST interface)
  • Возможность использования кастомного словаря (hotwords) для улучшения распознавания специфичных терминов
  • Поддержка word-level timestamps (таймстампов на уровне слов) для точной синхронизации
  • Возможность запуска через Docker, что упрощает настройку зависимостей и GPU-ускорение

👤 Кому подойдёт: разработчики, инженеры ML, специалисты по обработке аудио

Релизы

v0.10.0minor
🕐 14 дн назад · релиз на GitHub ↗

Добавлена поддержка AMD ROCm, улучшена работа с WebSocket и REST API, исправлены ошибки пакетного вывода.

  • Added: Добавлена поддержка GPU AMD ROCm для бэкенда faster_whisper.
  • Added: Внедрён StreamingTranscriptionClient для потоковой передачи из любых источников.
  • Added: REST API теперь поддерживает подсказки о говорящих, выбор модели и метаданные языка.
  • Fixed: Исправлена работа пакетного вывода (batch inference) и обработка ошибок WebSocket.
  • Fixed: Устранено зависание клиента в режиме ожидания перед получением первого аудиопотока.