Полный цикл Voice I/O без облака
Проект Voicebox позиционируется как бесплатная альтернатива ElevenLabs и WisprFlow, закрывающая оба конца цикла работы с голосом: синтез (TTS) и распознавание (STT). Ключевое отличие — local-first архитектура. Все модели, голосовые данные и транскрипты остаются на вашем устройстве, обеспечивая полную приватность. Приложение построено на Tauri (Rust), что гарантирует нативную производительность и низкое потребление ресурсов по сравнению с Electron-решениями.
7 движков синтеза и поддержка 23 языков
Главная техническая фишка Voicebox — выбор из семи различных TTS-движков, каждый из которых оптимизирован под свои задачи. Пользователи могут клонировать голос по короткому референсу (zero-shot) или использовать 50+ предустановленных голосов. Поддерживается генерация на 23 языках, включая английский, арабский, японский, хинди и суахили.
| Движок | Языки | Ключевые особенности |
|---|---|---|
| Qwen3-TTS (0.6B / 1.7B) | 10 | Высокое качество мультиязычного клонирования, управление подачей («шепот», «медленно») |
| Qwen CustomVoice | 10 | 9 пресетов с управлением через естественный язык, без референса |
| LuxTTS | English | Легковесный (~1GB VRAM), 48kHz, 150x realtime на CPU |
| Chatterbox Multilingual | 23 | Самый широкий охват языков (включая шведский, турецкий, греческий) |
| Chatterbox Turbo | English | Быстрая модель 350M, поддержка паралингвистических тегов ([laugh], [sigh]) |
| HumeAI TADA (1B / 3B) | 10 | Двухуровневое выравнивание текста и акустики, когерентность >700с |
| Kokoro | 50+ пресетов | Микроскопическая модель 82M, сверхбыстрая инференция на CPU |
Редактор историй и постобработка звука
Для создания подкастов и аудиокниг предусмотрен Stories Editor — многодорожечный таймлайн с возможностью перетаскивания клипов, синхронизированным воспроизведением и версионированием. Каждый сгенерированный фрагмент можно сохранить как «взятие» (take) с разными семенами для вариативности.
После синтеза доступны 8 эффектов на базе библиотеки Spotify pedalboard: сдвиг тона (до 12 полутонов), реверберация, задержка, хорус, компрессия, эквалайзеры (high/low pass) и регулировка громкости. Есть встроенные пресеты (Robotic, Radio, Echo Chamber) и возможность создания своих.
Голосовой ввод и интеграция с AI-агентами
Вторая половина цикла — диктовка. Voicebox использует модель OpenAI Whisper (Base/Small/Medium/Large/Turbo) для транскрипции. На macOS реализована «умная» вставка текста: при удержании горячей клавиши расшифровка вставляется в активное поле ввода с сохранением буфера обмена. Доступна очистка текста от слов-паразитов через встроенный LLM.
Приложение интегрируется с MCP-совместимыми агентами (Claude Code, Cursor, Cline). Через один вызов voicebox.speak любой агент может озвучить ответ выбранным голосом. Также доступен REST API и встроенный MCP-сервер для кастомных интеграций.
Системные требования и доступность
Voicebox работает на macOS (Apple Silicon via MLX/Metal, Intel), Windows (CUDA) и Linux (AMD ROCm, Intel Arc, Docker). Для Linux пока нет готовых бинарников, требуется сборка из исходников. Приложение полностью бесплатно и открыто на GitHub.
Источник: Github ↗
