abus-aikorea/voice-pro

Gradio WebUI для создателей и разработчиков с TTS (Edge-TTS, kokoro), zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), обработкой аудио Whisper, загрузкой YouTube, изоляцией вокала Demucs и многоязычным переводом.

Аудио⭐ 12 852Pythonпоследний релиз: v4.0.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Voice-Pro — это локальное Gradio WebUI-приложение для Windows, объединяющее распознавание речи, перевод и синтез голоса (TTS) с возможностью клонирования голоса.

Зачем нужен

Инструмент решает задачу создания многоязычных дубляжей и субтитров для видео, особенно с YouTube. Он полезен создателям контента и разработчикам, которым нужна альтернатива платным сервисам вроде ElevenLabs с поддержкой zero-shot клонирования голоса (E2, F5-TTS, CosyVoice) и мощным распознаванием (Whisper).

Что можно реализовать

  • Создание дубляжей YouTube-видоро на другие языки с сохранением оригинального тембра голоса (voice cloning)
  • Генерация субтитров и перевод аудио/видео контента на 100+ языков
  • Изоляция вокала и разделение аудио дорожек с помощью Demucs/MDX-Net
  • Конвертация текста в речь (TTS) с использованием Edge-TTS, kokoro или клонированных голосов

Ключевые возможности

  • Интеграция передовых моделей TTS: F5-TTS, E2-TTS, CosyVoice (включая Fun-CosyVoice3 для корейского и других языков)
  • Высокая точность распознавания речи благодаря стеку Faster-Whisper и Whisper-Timestamped
  • Полный цикл обработки: загрузка с YouTube, выделение аудио, перевод, TTS и сборка видео
  • Локальная работа на Windows с поддержкой NVIDIA GPU (CUDA), установка через uv
  • Открытый исходный код (LGPL), не требует внешних API-ключей для базовых функций (опционально Azure)

👤 Кому подойдёт: создатели контента (подкастеры, блогеры), разработчики AI-инструментов, исследователи в области NLP и TTS, переводчики

Релизы

v4.0.0majorbreaking
🕐 2 мес назад · релиз на GitHub ↗

Voice-Pro v4.0.0: полный переход на uv, поддержка RTX 50, Gradio 6, новые модели TTS и упрощенная установка без прав администратора.

  • Breaking: Инсталлятор переписан на uv: установка стала портативной, быстрой и не требует прав администратора или CUDA Toolkit.
  • Added: Обновлен стек: Python 3.12, Torch 2.8.0+cu128 с поддержкой RTX 50, Gradio 6.20.
  • Added: Добавлена опциональная модель TTS Fun-CosyVoice3-0.5B, поддерживающая 9 языков, включая корейский.
  • Deprecated: WhisperX удален из-за конфликтов зависимостей; конфигурации автоматически переключаются на faster-whisper.
  • Fixed: Улучшена надежность: самовосстановление при ошибках загрузки моделей, повторные попытки перевода при лимитах сети и видимые уведомления об ошибках в UI.