netease-youdao/EmotiVoice

EmotiVoice 😊: многоречевой TTS-движок с управлением через промпты

Аудио⭐ 8 528Pythonпоследний релиз: v0.3
Открыть на GitHub ↗

Что это за инструмент

EmotiVoice — это открытый движок синтеза речи (TTS) с поддержкой более 2000 голосов и управлением эмоциями через текстовые промпты.

Зачем нужен

Инструмент решает задачу генерации высококачественной речи на английском и китайском языках с заданной эмоциональной окраской (радость, грусть, гнев и др.). Он полезен для создания естественного и выразительного аудио-контента без необходимости записи каждого фрагмента вручную.

Что можно реализовать

  • Генерация эмоционально окрашенных озвучек для видео, игр или аудиокниг
  • Создание голосовых ассистентов с разнообразной интонацией
  • Массовая генерация аудио-контента через HTTP API или скрипты
  • Клонирование голоса на основе личных данных пользователя
  • Локальный запуск TTS через Docker для приватных задач

Ключевые возможности

  • Поддержка эмоционального синтеза через текстовые промпты
  • Библиотека из более чем 2000 различных голосов
  • Наличие OpenAI-compatible TTS API и готового Docker-образа
  • Возможность клонирования голоса по личным аудиоданным
  • Кроссплатформенность: работает на Linux/WSL2, есть нативное приложение для Mac

👤 Кому подойдёт: разработчики, исследователи в области NLP, создатели контента, бизнесы, нуждающиеся в автоматизации озвучки

Релизы