Инструменты5 июля 2026 г., 21:45 МСК🤖 Auto

Voicebox: локальный клонер голосов с 7 движками TTS и Whisper

Open-source студия Voicebox объединяет синтез речи, клонирование голосов и диктовку в одном приложении, работая полностью офлайн на вашем железе.

Баннер новости 2933

Полный цикл Voice I/O без облака

Проект Voicebox позиционируется как бесплатная альтернатива ElevenLabs и WisprFlow, закрывающая оба конца цикла работы с голосом: синтез (TTS) и распознавание (STT). Ключевое отличие — local-first архитектура. Все модели, голосовые данные и транскрипты остаются на вашем устройстве, обеспечивая полную приватность. Приложение построено на Tauri (Rust), что гарантирует нативную производительность и низкое потребление ресурсов по сравнению с Electron-решениями.

7 движков синтеза и поддержка 23 языков

Главная техническая фишка Voicebox — выбор из семи различных TTS-движков, каждый из которых оптимизирован под свои задачи. Пользователи могут клонировать голос по короткому референсу (zero-shot) или использовать 50+ предустановленных голосов. Поддерживается генерация на 23 языках, включая английский, арабский, японский, хинди и суахили.

Движок Языки Ключевые особенности
Qwen3-TTS (0.6B / 1.7B) 10 Высокое качество мультиязычного клонирования, управление подачей («шепот», «медленно»)
Qwen CustomVoice 10 9 пресетов с управлением через естественный язык, без референса
LuxTTS English Легковесный (~1GB VRAM), 48kHz, 150x realtime на CPU
Chatterbox Multilingual 23 Самый широкий охват языков (включая шведский, турецкий, греческий)
Chatterbox Turbo English Быстрая модель 350M, поддержка паралингвистических тегов ([laugh], [sigh])
HumeAI TADA (1B / 3B) 10 Двухуровневое выравнивание текста и акустики, когерентность >700с
Kokoro 50+ пресетов Микроскопическая модель 82M, сверхбыстрая инференция на CPU

Редактор историй и постобработка звука

Для создания подкастов и аудиокниг предусмотрен Stories Editor — многодорожечный таймлайн с возможностью перетаскивания клипов, синхронизированным воспроизведением и версионированием. Каждый сгенерированный фрагмент можно сохранить как «взятие» (take) с разными семенами для вариативности.

После синтеза доступны 8 эффектов на базе библиотеки Spotify pedalboard: сдвиг тона (до 12 полутонов), реверберация, задержка, хорус, компрессия, эквалайзеры (high/low pass) и регулировка громкости. Есть встроенные пресеты (Robotic, Radio, Echo Chamber) и возможность создания своих.

Голосовой ввод и интеграция с AI-агентами

Вторая половина цикла — диктовка. Voicebox использует модель OpenAI Whisper (Base/Small/Medium/Large/Turbo) для транскрипции. На macOS реализована «умная» вставка текста: при удержании горячей клавиши расшифровка вставляется в активное поле ввода с сохранением буфера обмена. Доступна очистка текста от слов-паразитов через встроенный LLM.

Приложение интегрируется с MCP-совместимыми агентами (Claude Code, Cursor, Cline). Через один вызов voicebox.speak любой агент может озвучить ответ выбранным голосом. Также доступен REST API и встроенный MCP-сервер для кастомных интеграций.

Системные требования и доступность

Voicebox работает на macOS (Apple Silicon via MLX/Metal, Intel), Windows (CUDA) и Linux (AMD ROCm, Intel Arc, Docker). Для Linux пока нет готовых бинарников, требуется сборка из исходников. Приложение полностью бесплатно и открыто на GitHub.

Источник: Github ↗