Релиз модели31 августа 2026 г., 17:47 МСК🤖 Auto

VoiceStudio: локальный ElevenLabs с 16 движками TTS и 646 языками

Вышел опенсорсный VoiceStudio — локальная платформа для клонирования голоса, дубляжа и синтеза речи. Полная приватность, 16 движков TTS, 11 ASR и отсутствие подписок.

Баннер новости 6429

Приватность вместо облака: суть VoiceStudio

Разработчики представили VoiceStudio (ранее OmniVoice-Studio) — приложение с открытым исходным кодом (лицензия AGPL-3.0), которое позиционируется как полностью локальная альтернатива сервисам вроде ElevenLabs. Ключевое отличие: вся обработка аудио, текстов и моделей происходит на вашем устройстве. Не требуется регистрация, API-ключи или подписки. Данные не покидают машину, что критично для работы с конфиденциальными аудиоматериалами.

Технические характеристики и поддержка платформ

Приложение кроссплатформенное и поддерживает macOS 13.3+ (Apple Silicon), Windows 10/11 x64 и Linux (x86_64, glibc 2.39+). Архитектура построена на Tauri v2, что обеспечивает легковесность. Поддерживаются различные бэкенды: CUDA, Apple Silicon MPS/MLX, ROCm и CPU. Для работы требуется минимум 8 ГБ ОЗУ и 10 ГБ свободного места, но для комфортной работы с моделями рекомендуется 16 ГБ ОЗУ и SSD.

Экосистема движков: 16 TTS и 11 ASR

VoiceStudio объединяет в себе огромный каталог моделей. Пользователь может выбирать между 16 движками синтеза речи (TTS) и 11 движками распознавания речи (ASR). Поддерживается каталог из 646 языков (качество зависит от выбранного движка). Среди популярных решений: OmniVoice (по умолчанию), CosyVoice 3, GPT-SoVITS, VoxCPM2, Sherpa-ONNX и WhisperX для транскрипции.

Категория Ключевые возможности Примеры движков/технологий
Синтез речи (TTS) Клонирование голоса (zero-shot), дизайн голоса, поддержка 646 языков OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, KittenTTS
Распознавание речи (ASR) Транскрипция, дубляж, определение спикеров, субтитры WhisperX (default), Faster-Whisper, Parakeet, Moonshine
Дополнительные функции Изоляция вокала, диктовка, AI-водяные знаки Demucs, Pyannote, AudioSeal, MCP Server

Практическое применение: от дубляжа до аудиокниг

Платформа предлагает готовые рабочие процессы (workflows), которые экономят время на настройке пайплайнов:

  • Клонирование голоса: достаточно 3-секундного образца для zero-shot синтеза, 5-15 секунд дают лучший результат.
  • Видеодубляж: автоматическая транскрипция, перевод, сохранение голосов спикеров и синтез новой дорожки.
  • Аудиокниги: поддержка импорта EPUB/PDF, многоголосое озвучивание и экспорт в формат .m4b.
  • Диктовка: системный виджет для живой транскрипции с опциональной локальной очисткой текста через LLM.

Почему это важно для индустрии

Выход VoiceStudio знаменует тренд на "Local-first" AI-инструменты. В отличие от облачных сервисов, где вы зависите от тарифных планов, ограничений по количеству запросов и политик конфиденциальности провайдера, здесь вы получаете полный контроль. Это особенно актуально для создателей контента, разработчиков и компаний, работающих с данными, которые нельзя передавать в третьи стороны. Приложение доступно для установки через DMG, MSI, AppImage и Docker, а также поддерживает запуск из исходного кода через Bun.

Источник: Github ↗