Uberi/speech_recognition

Модуль распознавания речи для Python, поддерживающий несколько движков и API, онлайн и офлайн.

Аудио⭐ 8 988Pythonпоследний релиз: 3.17.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

SpeechRecognition — это библиотека для Python, обеспечивающая распознавание речи с поддержкой множества онлайн- и офлайн-движков и API.

Зачем нужен

Инструмент позволяет конвертировать аудио (с микрофона или файлов) в текст, используя различные бэкенды. Он полезен для интеграции голосового ввода в приложения без необходимости писать низкоуровневый код для работы с каждым сервисом отдельно.

Что можно реализовать

  • Распознавание речи с микрофона в реальном времени
  • Транскрибация существующих аудиофайлов
  • Обнаружение горячих слов (hotword detection) с помощью Snowboy
  • Использование офлайн-распознавания через Vosk или OpenAI Whisper
  • Интеграция с облачными API (Google Cloud, Azure, IBM, Groq, Cohere)

Ключевые возможности

  • Поддержка широкого спектра движков: от локальных (CMU Sphinx, Vosk, Whisper) до облачных (Google, Azure, OpenAI)
  • Работа в офлайн-режиме с использованием локальных моделей
  • Простая установка через pip и наличие готовых примеров использования
  • Возможность калибровки порога чувствительности к шуму
  • Поддержка фоновой записи с микрофона

👤 Кому подойдёт: разработчики на Python, создающие голосовые интерфейсы или системы транскрибации

Релизы

3.17.0minor
🕐 3 мес назад · релиз на GitHub ↗

Добавлен метод AudioData.split() для работы с большими аудиофайлами, удалена устаревшая поддержка Bing Speech API.

  • Added: Добавлен метод AudioData.split() для разделения больших аудиофайлов на фрагменты.
  • Deprecated: Удалена поддержка устаревшего API Microsoft Bing Speech (recognize_bing).
  • Fixed: Исправлена стабильность CI-пайплайна в Linux за счет прямой установки ffmpeg.