Вышла версия v2.0.
FunAudioLLM/CosyVoice
Многоязычная большая модель генерации голоса, обеспечивающая полный стек возможностей для инференса, обучения и развертывания.
Что это за инструмент
CosyVoice — это мультиязычная модель генерации речи (TTS) на базе LLM, поддерживающая клонирование голоса, потоковую генерацию и тонкий контроль над интонацией.
Зачем нужен
Инструмент решает задачу синтеза высококачественной человеческой речи с нуля (zero-shot) или на основе короткого аудио-примера. Он полезен для создания реалистичных голосовых ассистентов, дубляжа и озвучки контента, так как обеспечивает высокую консистентность текста и естественность просодии без необходимости сложной предварительной обработки.
Что можно реализовать
- Генерация речи на 9 языках и 18+ диалектах китайского с возможностью кросс-языкового клонирования голоса
- Реализация low-latency приложений (задержка ~150 мс) благодаря поддержке bi-streaming режима
- Озвучка контента с точным контролем эмоций, скорости, громкости и языка через текстовые инструкции
- Автоматическая нормализация текста (числа, спецсимволы) и исправление произношения без использования внешних фронтендов
Ключевые возможности
- Поддержка 9 основных языков и более 18 китайских диалектов/акцентов
- Zero-shot voice cloning для мультиязычного и кросс-язычного синтеза
- Bi-streaming режим с задержкой около 150 мс при высоком качестве аудио
- Встроенная поддержка инструкций (emotions, speed, volume, language) и pronunciation inpainting
- Отсутствие необходимости в традиционном frontend-модуле для нормализации текста
👤 Кому подойдёт: Разработчики, исследователи в области NLP/TTS и бизнесы, ищущие open-source решение для генерации речи с высоким качеством и гибким контролем.