QuentinFuxa/WhisperLiveKit

Распознавание речи в реальном времени на локальном устройстве с потоковой передачей, разделением говорящих, переводом и API, совместимыми с OpenAI/Deepgram.

Аудио⭐ 11 075Pythonпоследний релиз: v0.2.26
Открыть на GitHub ↗

Что это за инструмент

WhisperLiveKit — это инструмент с открытым исходным кодом для локальной транскрипции речи в реальном времени с минимальной задержкой, поддерживающий распознавание, перевод и диаризацию спикеров.

Зачем нужен

Инструмент решает проблему плохого качества транскрипции при обработке коротких аудиофрагментов, характерную для стандартных моделей Whisper, за счет использования state-of-the-art алгоритмов одновременного распознавания (Simul-Whisper) и интеллектуального буферизации. Он полезен для создания систем, где критична скорость ответа и конфиденциальность данных, так как работает локально и предоставляет совместимые с OpenAI/Deepgram API.

Что можно реализовать

  • Реализация голосовых ассистентов с мгновенным ответом (low-latency) без задержек на отправку полного аудиофайла.
  • Создание систем субтитрирования подкастов, вебинаров или онлайн-трансляций в реальном времени.
  • Локальная обработка аудиозаписей встреч с автоматическим разделением спикеров (diarization) и переводом на 200+ языков.
  • Интеграция голосового ввода в десктопные или мобильные приложения (поддержка SwiftUI, WebSocket) с использованием OpenAI-совместимого API.

Ключевые возможности

  • Ultra-low-latency транскрипция благодаря алгоритмам Simul-Whisper и AlignAtt, обеспечивающим потоковую обработку без потери контекста.
  • Поддержка диаризации спикеров в реальном времени с использованием Streaming Sortformer.
  • Мгновенный перевод речи на 200+ языков с помощью дистиллированной модели NLLB.
  • Гибкая архитектура с поддержкой различных бэкендов (CUDA, Apple Silicon MLX, CPU) и моделей (Whisper, Qwen3-ASR, FunASR).
  • Совместимость с API OpenAI (REST) и Deepgram (WebSocket), что упрощает интеграцию с существующими SDK.

👤 Кому подойдёт: разработчики, создающие голосовые интерфейсы и сервисы обработки аудио; инженеры по машинному обучению, интересующиеся streaming ASR; бизнес, требующий локального хранения и обработки конфиденциальных аудиоданных.

Релизы

v0.2.26minor
🕐 22 дн назад · релиз на GitHub ↗

Добавлена поддержка NVIDIA Canary-1b-v2, улучшена диааризация и стабильность потоков Deepgram, исправлены ошибки обработки аудио.

  • Added: Добавлен бэкенд NVIDIA Canary-1b-v2 с поддержкой 25 европейских языков и нативными таймстампами.
  • Added: Невремянные транскрипты теперь могут включать диааризацию, длительность и точные таймстампы для каждого слова.
  • Added: Реализована опциональная коалесценция запросов ASR для снижения избыточных вычислений энкодера.
  • Fixed: Потоки, совместимые с Deepgram, теперь гарантируют стабильность дельт, слов, таймстампов и порядка событий.
  • Fixed: Исправлено разделение диааризированных текстов: сегменты больше не пересекают границы смены спикеров.
v0.2.25minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлена поддержка FunASR SenseVoiceSmall и исправлено прерывание диаризации в бэкенде qwen3.

  • Added: Добавлен бэкенд FunASR SenseVoiceSmall с поддержкой нескольких языков и валидацией таймстемпов.
  • Fixed: Исправлено молчание диаризации в бэкенде qwen3 благодаря нормализации токенов на границе фабрики.
  • Fixed: Устранена ошибка сегментов диаризации в функции concatenate_diar_segments.
  • Fixed: Исправлен краш при использовании кантонского языка с обрезкой по предложениям.
  • Fixed: Некорректные параметры сессии теперь возвращают структурированные ошибки вместо сбоев рукопожатия.