Прорыв в скорости и качестве синтеза
Лаборатория FunAudioLLM представила CosyVoice 3.0, систему преобразования текста в речь (TTS), построенную на архитектуре Large Language Model. Главная особенность релиза — би-стриминг (Bi-Streaming): модель обрабатывает входящий текст и генерирует аудио одновременно, что позволяет достичь задержки (latency) всего 150 мс при сохранении высокого качества звука. Это критически важно для интерактивных приложений, таких как голосовые помощники и живые трансляции.
Модель позиционируется как решение для синтеза речи в реальных условиях ("in the wild"), обеспечивая высочайшую согласованность контента, сходство голоса и естественность просодии по сравнению с предыдущей версией CosyVoice 2.0.
Масштабная поддержка языков и диалектов
CosyVoice 3.0 выделяется беспрецедентным охватом лингвистических данных. Помимо 9 основных языков (китайский, английский, японский, корейский, немецкий, испанский, французский, итальянский, русский), модель поддерживает 18 китайских диалектов и акцентов, включая кантонский, миньнань, сычуаньский, дунбэйский, шаньсийский, шаньдунский, шанхайский, тяньцзиньский, нинсяский и ганьсуский.
Архитектура позволяет проводить zero-shot клонирование голоса как в рамках одного языка, так и кросс-лингвально, что значительно упрощает создание мультиязычных голосовых ассистентов.
Сравнение с конкурентами: где CosyVoice лидирует
В бенчмарке CV3-Eval модель Fun-CosyVoice3-0.5B (базовая версия) и её RL-оптимизированная версия показывают конкурентоспособные результаты. Особое внимание стоит уделить метрике CER (Character Error Rate) для сложных тестовых наборов (test-hard) и SS (Speaker Similarity). RL-версия модели демонстрирует выдающиеся результаты по точности произношения.
| Модель | Размер | test-zh CER (%) ↓ | test-zh SS (%) ↑ | test-en WER (%) ↓ | test-hard CER (%) ↓ | test-hard SS (%) ↑ |
|---|---|---|---|---|---|---|
| Fun-CosyVoice3-0.5B | 0.5B | 1.21 | 78.0 | 2.24 | 6.71 | 75.8 |
| Fun-CosyVoice3-0.5B_RL | 0.5B | 0.81 | 77.4 | 1.68 | 5.44 | 75.0 |
| Seed-TTS | - | 1.12 | 79.6 | 2.25 | 7.59 | 77.6 |
| GLM-TTS RL | 1.5B | 0.89 | 76.4 | - | - | - |
| VoxCPM | 0.5B | 0.93 | 77.2 | 1.85 | 8.87 | 73.0 |
Примечание: Чем ниже CER/WER, тем точнее распознавание/произношение. Чем выше SS, тем лучше сходство голоса.
Технические возможности для продакшена
Для промышленного использования разработчики внедрили несколько ключевых функций:
- Pronunciation Inpainting: Возможность "дорисовки" произношения для китайских пиньинь и английских фонем CMU, что дает полный контроль над произношением сложных слов.
- Text Normalization: Встроенная обработка чисел, спецсимволов и сложных текстовых форматов без необходимости использования внешних фронтенд-модулей.
- Instruct Support: Управление эмоциями, скоростью, громкостью и языком через текстовые инструкции.
- Оптимизация: Поддержка vLLM (версии 0.9.0 и 0.11.x+) и NVIDIA TensorRT-LLM, что обеспечивает ускорение вывода в 4 раза по сравнению с базовым HuggingFace.
Доступность и дорожная карта
Модель Fun-CosyVoice3-0.5B-2512 уже доступна на Hugging Face и ModelScope. В roadmap на декабрь 2025 года запланирован релиз базовой модели и RL-версии с открытыми скриптами обучения. Для разработчиков доступны готовые Docker-контейнеры для развертывания через gRPC и FastAPI, а также веб-интерфейс для быстрого тестирования.
Бенчмарки
| Бенчмарк | CosyVoice2 | F5-TTS | Human | Index-TTS2 | MiniMax-Speech | Seed-TTS |
|---|---|---|---|---|---|---|
| test-zh CER | — | 1.52% | 1.26% | — | 0.83% | 1.12% |
| test-zh SS | — | 74.1% | 75.5% | — | 78.3% | 79.6% |
| test-en WER | — | 2% | 2.14% | — | 1.65% | 2.25% |
| test-en SS | — | 64.7% | 73.4% | — | 69.2% | 76.2% |
| test-hard CER | 6.83% | 8.67% | — | 7.12% | — | 7.59% |
| test-hard SS | 72.4% | 71.3% | — | 75.5% | — | 77.6% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
