VoxCPM2 вышла с моделью на 2 млрд параметров и обучением на 2+ млн часов речи. Она говорит на 30 языках и сразу отдаёт звук 48 кГц. Это уже уровень, где голос из текста звучит не как робот, а как живой человек.
Что реально изменилось: теперь голос можно не только копировать, но и «придумывать»

Главное нововведение, Voice Design (дизайн голоса), работает без образца. Вы просто описываете голос словами и получаете готовый результат. Например: «молодой спокойный голос, мягкий темп».
Второй шаг, Controllable Voice Cloning (управляемое клонирование голоса), берёт короткий аудиофрагмент и копирует тембр. Потом вы отдельно меняете эмоцию, скорость и подачу. Для роликов, подкастов и рекламы это экономит часы записи.
Есть и режим Ultimate Cloning (максимально точное клонирование). Он продолжает речь из референса почти без шва. Нужны аудио и точная расшифровка текста.
- 30 языков без ручного переключения тегов языка.
- 48 кГц на выходе, даже если входной референс 16 кГц.
- RTF (коэффициент реального времени) около 0.3 на RTX 4090.
- С ускорением Nano-vLLM (движок инференса) RTF падает до ~0.13.
- Лицензия Apache-2.0 (свободное коммерческое использование).
Зачем это сделали и что за этим стоит
Команда убрала этап tokenizer (разбиение речи на дискретные токены). Вместо этого модель генерирует непрерывные аудио-представления. На практике это даёт более плавные интонации и меньше «ломаных» фраз.
Архитектура называется diffusion autoregressive (пошаговая генерация с диффузией). Звучит сложно, но смысл простой: модель лучше держит ритм и эмоцию длинного текста. Для аудиокниг и обучающих курсов это критично.
Ещё один мотив, рынок устал от закрытых API (интерфейс программного доступа). Здесь код и веса открыты. Значит, можно запускать на своих серверах и не зависеть от внешних лимитов.
| Параметр | VoxCPM2 | VoxCPM1.5 |
|---|---|---|
| Параметры модели | 2B | 0.6B |
| Языки | 30 | 2 |
| Качество аудио | 48 кГц | 44.1 кГц |
| Voice Design | Да | Нет |
| Управляемый клон | Да | Нет |
| VRAM | ~8 ГБ | ~6 ГБ |
Как применить это прямо сейчас, даже в маленькой команде
Запуск начинается с одной команды: pip install voxcpm. Дальше можно поднять веб-демо локально и проверить качество за 10 минут. Если нужен продакшн, подключается Nano-vLLM (движок для быстрых одновременных запросов).
Кому это полезно в реальной работе:
- Маркетологам, быстро собирать озвучку объявлений под разные страны.
- Продакт-командам, делать голосовых ассистентов без студийной записи.
- Разработчикам, встроить TTS (синтез речи) через Python API (интерфейс).
- EdTech (образовательные сервисы), выпускать курсы на нескольких языках.
- Медиа, тестировать новые голоса без кастингов и долгого продакшна.
Где смотреть проект: GitHub VoxCPM. Там же есть документация, примеры кода и инструкции по деплою (развёртыванию).
Мы вошли в этап, где голос становится программируемым интерфейсом, как текст 2 года назад. Следующий скачок будет не «лучше звучит», а «умеет говорить как ваш бренд по умолчанию».
