babysor/MockingBird

🚀Клонируй голос за 5 секунд для генерации произвольной речи в реальном времени

Аудио⭐ 36 903Pythonпоследний релиз: v0.0.1
Открыть на GitHub ↗

Что это за инструмент

MockingBird — это инструмент для клонирования голоса, позволяющий синтезировать речь на основе короткого аудиоэталона (5 секунд) с поддержкой русского и китайского языков.

Зачем нужен

Инструмент решает задачу преобразования текста в речь (TTS) с использованием уникального тембра голоса, что полезно для создания контента, озвучки и прототипирования. Он позволяет быстро получить реалистичную речь без необходимости полной переобучения модели, используя предварительно обученные энкодер и вокодер.

Что можно реализовать

  • Генерация речи на китайском и русском языках с клонированием конкретного голоса
  • Создание аудио-прототипов и демо-версий продуктов с использованием разных голосов
  • Интеграция синтеза речи через веб-сервер для удаленного вызова API
  • Локальный запуск TTS-системы на Windows, Linux и macOS (включая M1 с Rosetta)

Ключевые возможности

  • Клонирование голоса по короткому эталону (5 секунд)
  • Поддержка Mandarin Chinese и тестирование на нескольких датасетах
  • Работа с PyTorch (версии 1.9.0+) на GPU (Tesla T4, GTX 2060)
  • Кроссплатформенность: Windows, Linux, macOS (M1)
  • Готовность к использованию в качестве веб-сервиса (Webserver Ready)

👤 Кому подойдёт: разработчики, исследователи в области NLP, создатели контента, интересующиеся локальным запуском AI-моделей

Релизы