debpalash/VoiceStudio

VoiceStudio — это open-source, полностью локальная альтернатива ElevenLabs: клонирование голоса, дизайн голоса, дубляж видео, диктовка, транскрипция и создание аудиокниг на 646 языках. Без аккаунтов, ключей API и облака.

Аудио⭐ 33 619Pythonпоследний релиз: v0.5.4
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

VoiceStudio — это локальное десктопное приложение с открытым исходным кодом для клонирования голосов, синтеза речи, дубляжа видео и создания аудиокниг, работающее без облачных сервисов.

Зачем нужен

Инструмент позволяет генерировать и обрабатывать аудиофайлы исключительно на локальном оборудовании пользователя, исключая необходимость в подписках, API-ключах или передаче данных в облако. Это обеспечивает полный контроль над приватностью и отсутствие ограничений по объему генерации.

Что можно реализовать

  • Клонирование голоса по короткому (3 секунды) аудиофрагменту для создания персонализированного синтезатора речи.
  • Дубляж видео на 646 языках с сохранением оригинальной интонации и тембра.
  • Создание аудиокниг и озвучка текстов с использованием локальных TTS-движков.
  • Диктовка и транскрипция речи в офлайн-режиме для обеспечения конфиденциальности данных.

Ключевые возможности

  • Полностью локальная работа (local-first): нет подписок, счетчиков использования и облачных зависимостей.
  • Поддержка 646 языков и гибкая архитектура с возможностью подключения внешних TTS-движков.
  • Кроссплатформенность: доступна для macOS, Windows и Linux (включая Docker).
  • Открытая лицензия AGPL-3.0 и активное сообщество через Discord и GitHub.

👤 Кому подойдёт: разработчики, энтузиасты локальных AI-решений, создатели контента, ценящие приватность, исследователи, работающие с конфиденциальными данными

Релизы

v0.5.4minor
🕐 10 ч назад · релиз на GitHub ↗

Ремонт CosyVoice, улучшенные дубляжи и EPUB, интеграция MCP для Claude Code/Cursor, стабильность Electron.

  • Fixed: Восстановлена работа CosyVoice с новыми версиями Transformers и исправлены ошибки установки движков без удаления моделей.
  • Added: Добавлена интеграция MCP для настройки Claude Code и Cursor, а также экспорт локальных рабочих процессов n8n.
  • Added: Улучшено сохранение диалогов, таймингов и фоновой музыки при дубляже и импорте субтитров.
  • Added: Расширены возможности разбора текста в Stories (по предложениям, абзацам, главам) и добавлена кнопка полной очистки сценария.
  • Fixed: Повышена надежность установки Electron, улучшена диагностика сбоев и нормализована работа с прокси на Windows.
v0.5.3majorbreaking
🕐 4 дн назад · релиз на GitHub ↗

Переход на Electron, обновление каталога моделей и улучшенное дубляж с исправлениями багов.

  • Breaking: Приложение переписано на Electron; Tauri больше не поддерживается, требуется миграция.
  • Added: Добавлена поддержка моделей VoxCPM2, MOSS-TTS-Nano и CosyVoice 3 с установкой в один клик.
  • Added: Каталог моделей объединен в одну страницу с удобным переключением движков и загрузкой весов.
  • Added: Улучшен интерфейс дубляжа: синхронизация, сохранение тона, исправление кэшей и защита от обрезки.
  • Fixed: Исправлены ошибки воспроизведения видео, работы на macOS/Linux и интеграции с YouTube.
v0.5.2minor
🕐 10 дн назад · релиз на GitHub ↗

Релиз v0.5.2: улучшена установка движков, исправлены ошибки интерфейса и поддержки GPU, добавлена светлая тема.

  • Added: Упрощена установка MOSS-TTS-v1.5, Confucius4-TTS, Supertonic-3 и PocketTTS: каждый движок устанавливается в изолированную среду одним кликом.
  • Added: Добавлена светлая тема оформления и переключатель «Системная авто» для следования настройкам ОС, а также переключатель «Снизить анимацию».
  • Added: Улучшено меню транскрипции: добавлен выбор моделей Sherpa-ONNX, подсказки по загрузке и сравнение моделей по точности и скорости.
  • Fixed: Исправлены ошибки отображения: теперь движки корректно сообщают о недоступности платформы, а ошибки генерации классифицируются точнее.
  • Fixed: Устранены проблемы с установкой на Windows, восстановлена работа превью голосов в галерее и улучшена обработка таймаутов генерации.
v0.5.1minor
🕐 23 дн назад · релиз на GitHub ↗

VoiceStudio v0.5.1: локальная платформа с MCP/HTTP, стабильность на Apple Silicon/Windows, улучшение дубляжа и Docker.

  • Added: VoiceStudio стал локальной речевой платформой: другие приложения могут вызывать диктовку или подключаться через HTTP, WebSocket, JSON-RPC, CLI и MCP.
  • Fixed: Генерация OmniVoice на Apple Silicon теперь работает в изолированном процессе, предотвращая падение бэкенда при ошибках памяти MPS.
  • Fixed: Исправлены критические ошибки Windows (0xC0000005, 0x40010004), связанные с перекрывающимися вызовами WhisperX и некорректной обработкой аварийного завершения.
  • Added: Добавлена поддержка заголовочных машин NVIDIA и ROCm в качестве worker-сервисов через Docker Compose без интерфейса.
  • Fixed: Улучшен процесс дубляжа: разделены языки, сохранены переводы при очистке сегментов, добавлена возможность повтора или пропуска неудачных переводов.
v0.5.0major
🕐 1 мес назад · релиз на GitHub ↗

VoiceStudio v0.5.0: ребрендинг, каталог моделей, распределённый GPU, защищённый серверный режим и улучшенная диктовка.

  • Added: Приложение переименовано в VoiceStudio; добавлен единый каталог моделей с маршрутизацией устройств и статусом установки.
  • Added: Возможность использования GPU удалённых машин через QR-код и join-код с защитой сертификатов.
  • Added: Серверный режим: административные действия требуют API-ключа, а удалённый UI использует кратковременные сессии без хранения в браузере.
  • Added: Улучшенная рабочая область Dub для многоязычного производства и сохранение голосов из галереи в локальные профили.
  • Fixed: Исправлена работа диктовки на Wayland, возвращена панель записи, улучшена навигация в настройках и каталоге.