FunAudioLLM/CosyVoice

Многоязычная большая модель генерации голоса, обеспечивающая полный стек возможностей для инференса, обучения и развертывания.

Аудио⭐ 23 709Pythonпоследний релиз: v2.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

CosyVoice — это мультиязычная модель генерации речи (TTS) на базе LLM, поддерживающая клонирование голоса, потоковую генерацию и тонкий контроль над интонацией.

Зачем нужен

Инструмент решает задачу синтеза высококачественной человеческой речи с нуля (zero-shot) или на основе короткого аудио-примера. Он полезен для создания реалистичных голосовых ассистентов, дубляжа и озвучки контента, так как обеспечивает высокую консистентность текста и естественность просодии без необходимости сложной предварительной обработки.

Что можно реализовать

  • Генерация речи на 9 языках и 18+ диалектах китайского с возможностью кросс-языкового клонирования голоса
  • Реализация low-latency приложений (задержка ~150 мс) благодаря поддержке bi-streaming режима
  • Озвучка контента с точным контролем эмоций, скорости, громкости и языка через текстовые инструкции
  • Автоматическая нормализация текста (числа, спецсимволы) и исправление произношения без использования внешних фронтендов

Ключевые возможности

  • Поддержка 9 основных языков и более 18 китайских диалектов/акцентов
  • Zero-shot voice cloning для мультиязычного и кросс-язычного синтеза
  • Bi-streaming режим с задержкой около 150 мс при высоком качестве аудио
  • Встроенная поддержка инструкций (emotions, speed, volume, language) и pronunciation inpainting
  • Отсутствие необходимости в традиционном frontend-модуле для нормализации текста

👤 Кому подойдёт: Разработчики, исследователи в области NLP/TTS и бизнесы, ищущие open-source решение для генерации речи с высоким качеством и гибким контролем.

Релизы