Релиз модели14 июля 2026 г., 11:46 МСК🤖 Auto

CosyVoice 3.0: LLM-синтез речи с задержкой 150 мс и поддержкой 18 диалектов

FunAudioLLM выпустили CosyVoice 3.0 — модель TTS на базе LLM, превосходящую аналоги по естественности и скорости. Новинка поддерживает zero-shot клонирование голоса на 9 языках и 18 китайских диалектах с задержкой всего 150 мс.

Баннер новости 3527

Прорыв в скорости и качестве синтеза

Лаборатория FunAudioLLM представила CosyVoice 3.0, систему преобразования текста в речь (TTS), построенную на архитектуре Large Language Model. Главная особенность релиза — би-стриминг (Bi-Streaming): модель обрабатывает входящий текст и генерирует аудио одновременно, что позволяет достичь задержки (latency) всего 150 мс при сохранении высокого качества звука. Это критически важно для интерактивных приложений, таких как голосовые помощники и живые трансляции.

Модель позиционируется как решение для синтеза речи в реальных условиях ("in the wild"), обеспечивая высочайшую согласованность контента, сходство голоса и естественность просодии по сравнению с предыдущей версией CosyVoice 2.0.

Масштабная поддержка языков и диалектов

CosyVoice 3.0 выделяется беспрецедентным охватом лингвистических данных. Помимо 9 основных языков (китайский, английский, японский, корейский, немецкий, испанский, французский, итальянский, русский), модель поддерживает 18 китайских диалектов и акцентов, включая кантонский, миньнань, сычуаньский, дунбэйский, шаньсийский, шаньдунский, шанхайский, тяньцзиньский, нинсяский и ганьсуский.

Архитектура позволяет проводить zero-shot клонирование голоса как в рамках одного языка, так и кросс-лингвально, что значительно упрощает создание мультиязычных голосовых ассистентов.

Сравнение с конкурентами: где CosyVoice лидирует

В бенчмарке CV3-Eval модель Fun-CosyVoice3-0.5B (базовая версия) и её RL-оптимизированная версия показывают конкурентоспособные результаты. Особое внимание стоит уделить метрике CER (Character Error Rate) для сложных тестовых наборов (test-hard) и SS (Speaker Similarity). RL-версия модели демонстрирует выдающиеся результаты по точности произношения.

Модель Размер test-zh CER (%) ↓ test-zh SS (%) ↑ test-en WER (%) ↓ test-hard CER (%) ↓ test-hard SS (%) ↑
Fun-CosyVoice3-0.5B 0.5B 1.21 78.0 2.24 6.71 75.8
Fun-CosyVoice3-0.5B_RL 0.5B 0.81 77.4 1.68 5.44 75.0
Seed-TTS - 1.12 79.6 2.25 7.59 77.6
GLM-TTS RL 1.5B 0.89 76.4 - - -
VoxCPM 0.5B 0.93 77.2 1.85 8.87 73.0

Примечание: Чем ниже CER/WER, тем точнее распознавание/произношение. Чем выше SS, тем лучше сходство голоса.

Технические возможности для продакшена

Для промышленного использования разработчики внедрили несколько ключевых функций:

  • Pronunciation Inpainting: Возможность "дорисовки" произношения для китайских пиньинь и английских фонем CMU, что дает полный контроль над произношением сложных слов.
  • Text Normalization: Встроенная обработка чисел, спецсимволов и сложных текстовых форматов без необходимости использования внешних фронтенд-модулей.
  • Instruct Support: Управление эмоциями, скоростью, громкостью и языком через текстовые инструкции.
  • Оптимизация: Поддержка vLLM (версии 0.9.0 и 0.11.x+) и NVIDIA TensorRT-LLM, что обеспечивает ускорение вывода в 4 раза по сравнению с базовым HuggingFace.

Доступность и дорожная карта

Модель Fun-CosyVoice3-0.5B-2512 уже доступна на Hugging Face и ModelScope. В roadmap на декабрь 2025 года запланирован релиз базовой модели и RL-версии с открытыми скриптами обучения. Для разработчиков доступны готовые Docker-контейнеры для развертывания через gRPC и FastAPI, а также веб-интерфейс для быстрого тестирования.

Бенчмарки

БенчмаркCosyVoice2F5-TTSHumanIndex-TTS2MiniMax-SpeechSeed-TTS
test-zh CER1.52%1.26%0.83%1.12%
test-zh SS74.1%75.5%78.3%79.6%
test-en WER2%2.14%1.65%2.25%
test-en SS64.7%73.4%69.2%76.2%
test-hard CER6.83%8.67%7.12%7.59%
test-hard SS72.4%71.3%75.5%77.6%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗