Открытый код и смена стратегии
Команда abus-aikorea объявила о переходе Voice-Pro в статус полностью открытого ПО (Open Source). Ранее проект предлагал платную подписку для снятия ограничений, но теперь весь код доступен на GitHub. Это делает Voice-Pro серьезной альтернативой коммерческим решениям вроде ElevenLabs для создателей контента, подкастеров и исследователей. Разработчики также запустили новый проект WeConnect для культурного обмена, сосредоточившись на нем, но оставив Voice-Pro свободным для сообщества.
Технический прорыв: Версия 4.0
Выпуск версии 4.0 принес радикальные изменения в стек технологий. Установка теперь управляется через uv (вместо Miniconda/pip), что обеспечивает мгновенный и воспроизводимый деплой. Ключевые обновления:
- Runtime: Python 3.12, PyTorch 2.8.0+cu128, Gradio 6.20.
- GPU: Официальная поддержка видеокарт NVIDIA RTX 50-й серии. Установка CUDA Toolkit больше не требуется — PyTorch включает необходимый рантайм.
- ASR (Распознавание речи): Обновлены Faster-Whisper (1.2.1, модели large-v3-turbo, distil-large-v3.5), OpenAI Whisper (20250625) и Whisper-Timestamped (1.15.9). Модуль whisperX удален из-за конфликтов зависимостей.
- TTS (Генерация речи): F5-TTS (1.1.21), kokoro (0.9.4), Edge-TTS (7.x) и ре-верденный CosyVoice.
Новые возможности клонирования голоса
В интерфейс добавлена модель Fun-CosyVoice3-0.5B, поддерживающая 9 языков, включая корейский. Приложение интегрирует инструменты для разделения голоса (Demucs), скачивания видео с YouTube (yt-dlp) и перевода более чем на 100 языков через Deep-Translator. Для корпоративных пользователей добавлена устойчивость к ограничениям сети: при блокировке бесплатных API система автоматически повторяет запросы с экспоненциальной задержкой.
Сравнение стеков технологий
| Компонент | Версия 3.x (Старый стек) | Версия 4.0 (Новый стек) |
|---|---|---|
| Установка | Miniconda / pip | uv (fast, reproducible) |
| Python / PyTorch | 3.10 / 2.5.1+cu124 | 3.12 / 2.8.0+cu128 |
| Gradio 5.14.0 | Gradio 6.20 | |
| ASR Engine | WhisperX, Faster-Whisper | Faster-Whisper 1.2.1, Whisper 20250625 |
| TTS Models | CosyVoice2, kokoro 0.9.x | F5-TTS 1.1.21, CosyVoice3, kokoro 0.9.4 |
| Требования к правам | Администратор (частично) | Не требуются (portable mode) |
Системные требования и установка
Приложение работает на Windows 10/11, Linux и macOS (Apple Silicon). Для комфортной работы требуется GPU NVIDIA с 4 ГБ+ VRAM (рекомендуется 8 ГБ+), 4 ГБ+ ОЗУ и 20 ГБ свободного места. Установка сводится к запуску скриптов configure.bat и start.bat. Ошибки теперь отображаются в виде красных уведомлений (toasts) прямо в интерфейсе, что упрощает диагностику проблем, таких как отсутствие ffmpeg или сбои сети.
Источник: Github ↗
