debpalash/OmniVoice-Studio

Альтернатива ElevenLabs с открытым исходным кодом для локального клонирования голоса, дизайна, создания, дубляжа и диктовки в десктопном приложении

Аудио⭐ 33 619Pythonпоследний релиз: v0.5.4
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

OmniVoice Studio — это локальное десктопное приложение с открытым исходным кодом для клонирования голоса, синтеза речи (TTS) и дубляжа видео, работающее полностью офлайн без использования облачных API.

Зачем нужен

Инструмент решает задачу приватной и независимой обработки аудио, позволяя пользователям клонировать голоса, создавать новые голосовые профили и переводить видео на другие языки без отправки данных на сторонние серверы. Он полезен для тех, кто хочет избежать ежемесячных подписок и ограничений облачных сервисов, получая полный контроль над своими аудиоданными.

Что можно реализовать

  • Клонирование голоса по короткому 3-секундному образцу (zero-shot) для генерации речи на 646 языках.
  • Создание синтетических голосов с нуля с настройкой пола, возраста, акцента, высоты тона и эмоций.
  • Полный цикл дубляжа видео: транскрипция, перевод и переозвучка с сохранением тайминга для экспорта в MP4.
  • Диктовка в реальном времени с использованием локальных моделей распознавания речи (ASR).
  • Использование встроенного локального REST API для интеграции с другими приложениями.

Ключевые возможности

  • Полностью локальная работа: нет API-ключей, аккаунтов, облака и подписок.
  • Поддержка 14 движков TTS и 12 движков ASR с автоматическим выбором моделей под GPU (CUDA/MPS) или CPU.
  • Генерация речи на 646 языках и клонирование голоса за 3 секунды.
  • Встроенная галерея готовых голосовых архетипов и инструменты для создания новых.
  • Открытый исходный код (AGPL-3.0) и активная бета-версия с поддержкой сообщества.

👤 Кому подойдёт: разработчики, энтузиасты локального ИИ, создатели контента, нуждающиеся в приватности, и исследователи, работающие с аудио-моделями.

Релизы

v0.5.4minor
🕐 10 ч назад · релиз на GitHub ↗

Ремонт CosyVoice, улучшение экспорта историй и аудиокниг, интеграция MCP для Claude Code и Cursor, стабилизация Electron.

  • Fixed: Восстановлена работа CosyVoice: исправлены зависимости runtime и сохранен контекст речи при обновлении Transformers.
  • Added: Добавлены страницы настройки MCP для интеграции с Claude Code и Cursor, а также консолидация каталогов.
  • Added: Улучшена работа с историями и аудиокнигами: добавлена кнопка очистки скрипта, гибкое разделение текста и стабильный импорт EPUB.
  • Added: Сохраняются диалоги, тайминги и фоновый звук при дубляже и импорте субтитров.
  • Fixed: Стабилизирована установка Electron: улучшены отчеты о сбоях, нормализованы прокси и ускорен запуск с готовым Python-рантаймом.
v0.5.3majorbreaking
🕐 4 дн назад · релиз на GitHub ↗

Переход на Electron, новые модели VoxCPM2 и CosyVoice 3, редизайн каталога и улучшенное дубляж.

  • Breaking: Tauri заменен на Electron как основную платформу; требуется ручная миграция и резервное копирование данных.
  • Added: Добавлена поддержка моделей VoxCPM2, MOSS-TTS-Nano и CosyVoice 3 с установкой в один клик.
  • Added: Каталог моделей объединен в одну страницу, а интеграции расширены до 100+ инструментов с новой боковой панелью.
  • Fixed: Улучшено качество дубляжа: исправлены таймлайны, сохранение тона, фоновый звук и кэширование речи.
  • Fixed: Исправлены ошибки интерфейса Electron, видеоплеера, macOS-сайдбара и блокировки YouTube-ссылок.
v0.5.2minor
🕐 10 дн назад · релиз на GitHub ↗

Релиз v0.5.2: улучшена стабильность, исправлены ошибки интерфейса и установки, добавлена светлая тема и поддержка Apple Silicon.

  • Added: Добавлена светлая тема и автоматическое переключение на неё в зависимости от настроек ОС.
  • Added: Улучшена работа с Apple Silicon: унифицирован выбор движка и сохранена изолированная среда выполнения.
  • Fixed: Исправлены ошибки установки моделей (Supertonic-3, PocketTTS и др.) и улучшена обработка сбоев при нехватке памяти GPU.
  • Fixed: Улучшены сообщения об ошибках: теперь указываются конкретные классы ошибок и причины сбоев вместо общих уведомлений.
  • Fixed: Исправлены проблемы с запуском на Windows, восстановлена работа предпросмотров голосов и корректное произношение числовых диапазонов.
v0.5.1minor
🕐 23 дн назад · релиз на GitHub ↗

OmniVoice v0.5.1: стабильность Apple Silicon и Windows, новые API для интеграции, улучшенное дубляж-движение и поддержка Linux ARM64.

  • Added: VoiceStudio стал локальной речевой платформой: другие приложения могут подключаться через HTTP, WebSocket, JSON-RPC, CLI и MCP.
  • Fixed: Генерация на Apple Silicon теперь работает в изолированном процессе, предотвращая падение бэкенда при ошибках памяти MPS.
  • Fixed: Исправлены критические ошибки Windows (0xC0000005, 0x40010004), связанные с перекрывающимся доступом WhisperX и ложными перезапусками.
  • Added: Добавлена поддержка Linux ARM64 (Asahi Apple Silicon) и возможность подключения headless-нод NVIDIA/ROCm через Docker Compose.
  • Fixed: Улучшен процесс дубляжа: разделение языков, сохранение переводов, ретайминг субтитров и нормализация видео в H.264/AAC.
v0.5.0major
🕐 1 мес назад · релиз на GitHub ↗

Релиз VoiceStudio v0.5.0: ребрендинг, каталог моделей, совместное использование GPU и улучшенная диктовка.

  • Added: Приложение переименовано в VoiceStudio; добавлен единый каталог моделей для управления TTS, ASR и LLM.
  • Added: Реализовано совместное использование GPU через QR-код и защищённые соединения с привязкой сертификатов.
  • Added: Улучшена работа диктовки на Wayland и возвращена панель записи; добавлен серверный режим с защитой API-ключами.
  • Added: Обновлён интерфейс Launchpad и каталога: улучшена навигация, темизация и отображение статуса доступности движков.
  • Added: Голоса из галереи теперь можно сохранять как локальные профили с проверенными ссылками.
v0.4.2minor
🕐 1 мес назад · релиз на GitHub ↗

Обновление OmniVoice Studio v0.4.2: улучшена установка обновлений, исправлена работа с моделями и интерфейсом на разных языках.

  • Added: Уведомления об обновлениях теперь отображаются в виде всплывающих окон с кнопками, а не разворачивают полный список изменений.
  • Fixed: Установка обновления больше не прерывает и не теряет текущие задачи, такие как синтез, транскрипция или экспорт.
  • Fixed: Исправлена автоматическая восстановление поврежденных моделей после прерванного скачивания.
  • Fixed: Корректная обработка завершения работы приложения при наличии задач генерации без ложных сообщений об ошибках.
  • Fixed: Исправлен перевод кнопки «Dismiss» на немецком, японском, русском и китайском языках.
v0.3.12minor
🕐 2 мес назад · релиз на GitHub ↗

Выбор движка MLX-Audio теперь доступен, исправлены проблемы с установкой и сетью, устранён скрытый эхо-эффект.

  • Added: Пользователи могут выбирать модели MLX-Audio (CSM, Qwen3-TTS, Dia и др.) вместо принудительного Kokoro.
  • Fixed: Установка больше не блокируется на ограниченных сетях или за корпоративными прокси с TLS-инспекцией.
  • Fixed: Выбранный движок теперь корректно применяется к функциям дубляжа и пакетного синтеза.
  • Fixed: Устранён скрытый реверберационный эффект, который искажал чистоту звука даже в режимах без эха.
  • Fixed: Исправлен сбой ROCm-установки на AMD, падение при выборе неподдерживаемых языков и ошибки панели голосов.