Инструменты1 сентября 2026 г., 21:48 МСК🤖 Auto

Voice-Pro 4.0: Бесплатный аналог ElevenLabs с поддержкой RTX 50

Разработчики открыли исходный код Voice-Pro 4.0 — мощного веб-приложения для дубляжа и клонирования голоса. Теперь инструмент полностью бесплатен, поддерживает Python 3.12, Gradio 6 и видеокарты NVIDIA RTX 50-й серии.

Баннер новости 6526

Открытый код и смена стратегии

Команда abus-aikorea объявила о переходе Voice-Pro в статус полностью открытого ПО (Open Source). Ранее проект предлагал платную подписку для снятия ограничений, но теперь весь код доступен на GitHub. Это делает Voice-Pro серьезной альтернативой коммерческим решениям вроде ElevenLabs для создателей контента, подкастеров и исследователей. Разработчики также запустили новый проект WeConnect для культурного обмена, сосредоточившись на нем, но оставив Voice-Pro свободным для сообщества.

Технический прорыв: Версия 4.0

Выпуск версии 4.0 принес радикальные изменения в стек технологий. Установка теперь управляется через uv (вместо Miniconda/pip), что обеспечивает мгновенный и воспроизводимый деплой. Ключевые обновления:

  • Runtime: Python 3.12, PyTorch 2.8.0+cu128, Gradio 6.20.
  • GPU: Официальная поддержка видеокарт NVIDIA RTX 50-й серии. Установка CUDA Toolkit больше не требуется — PyTorch включает необходимый рантайм.
  • ASR (Распознавание речи): Обновлены Faster-Whisper (1.2.1, модели large-v3-turbo, distil-large-v3.5), OpenAI Whisper (20250625) и Whisper-Timestamped (1.15.9). Модуль whisperX удален из-за конфликтов зависимостей.
  • TTS (Генерация речи): F5-TTS (1.1.21), kokoro (0.9.4), Edge-TTS (7.x) и ре-верденный CosyVoice.

Новые возможности клонирования голоса

В интерфейс добавлена модель Fun-CosyVoice3-0.5B, поддерживающая 9 языков, включая корейский. Приложение интегрирует инструменты для разделения голоса (Demucs), скачивания видео с YouTube (yt-dlp) и перевода более чем на 100 языков через Deep-Translator. Для корпоративных пользователей добавлена устойчивость к ограничениям сети: при блокировке бесплатных API система автоматически повторяет запросы с экспоненциальной задержкой.

Сравнение стеков технологий

d>UI Framework
Компонент Версия 3.x (Старый стек) Версия 4.0 (Новый стек)
Установка Miniconda / pip uv (fast, reproducible)
Python / PyTorch 3.10 / 2.5.1+cu124 3.12 / 2.8.0+cu128
Gradio 5.14.0 Gradio 6.20
ASR Engine WhisperX, Faster-Whisper Faster-Whisper 1.2.1, Whisper 20250625
TTS Models CosyVoice2, kokoro 0.9.x F5-TTS 1.1.21, CosyVoice3, kokoro 0.9.4
Требования к правам Администратор (частично) Не требуются (portable mode)

Системные требования и установка

Приложение работает на Windows 10/11, Linux и macOS (Apple Silicon). Для комфортной работы требуется GPU NVIDIA с 4 ГБ+ VRAM (рекомендуется 8 ГБ+), 4 ГБ+ ОЗУ и 20 ГБ свободного места. Установка сводится к запуску скриптов configure.bat и start.bat. Ошибки теперь отображаются в виде красных уведомлений (toasts) прямо в интерфейсе, что упрощает диагностику проблем, таких как отсутствие ffmpeg или сбои сети.

Источник: Github ↗