alphacep/vosk-api

API офлайн-распознавания речи для Android, iOS, Raspberry Pi и серверов с Python, Java, C# и Node

Аудио⭐ 15 140Jupyter Notebookпоследний релиз: v0.3.50
Открыть на GitHub ↗

Что это за инструмент

Vosk — это офлайн-инструмент для распознавания речи, работающий локально на устройствах от смартфонов до серверов.

Зачем нужен

Инструмент решает задачу непрерывной транскрибации речи в текст с нулевой задержкой без необходимости отправки данных в облако. Это полезно для создания приватных голосовых помощников, умных устройств и систем субтитрирования, где важна скорость и безопасность данных.

Что можно реализовать

  • Разработка голосовых интерфейсов для чат-ботов и виртуальных ассистентов
  • Создание субтитров для фильмов и транскрипция лекций или интервью
  • Интеграция голосового управления в умные домашние устройства (smart home)
  • Реализация распознавания речи на Raspberry Pi, Android и iOS

Ключевые возможности

  • Полная офлайн-работа: не требует подключения к интернету
  • Поддержка 20+ языков и диалектов, включая русский, английский, немецкий, китайский
  • Низкое потребление ресурсов: модели весят около 50 Мб
  • Кроссплатформенность: биндинги для Python, Java, Node.JS, C#, C++, Rust, Go
  • Наличие streaming API для мгновенного ответа и идентификации говорящего

👤 Кому подойдёт: разработчики, создающие голосовые интерфейсы и умные устройства; бизнес, заинтересованный в приватных решениях для транскрибации и голосового управления

Релизы

v0.3.50patch
🕐 29 мес назад · релиз на GitHub ↗

Обновления конфигурации эндпоинтера в библиотеке Vosk API.

  • Added: Добавлены новые параметры конфигурации для настройки работы эндпоинтера.