Вышла версия v2.0.
QwenAudio/CosyVoice
Многоязычная большая модель генерации голоса, обеспечивающая полный стек возможностей для инференса, обучения и развертывания.
Что это за инструмент
CosyVoice — это открытая модель синтеза речи (TTS) на базе больших языковых моделей (LLM), поддерживающая генерацию голоса на нескольких языках с возможностью клонирования без предварительного обучения (zero-shot).
Зачем нужен
Инструмент решает задачу высококачественной генерации естественной речи из текста, обеспечивая высокую консистентность контента и сходство с целевым голосом. Он полезен для создания голосовых ассистентов, аудиокниг и интерактивных приложений, так как поддерживает потоковую передачу с низкой задержкой и тонкую настройку параметров (эмоции, скорость, диалекты).
Что можно реализовать
- Создание голосовых ассистентов с поддержкой потоковой генерации (latency ~150ms) для интерактивного общения.
- Генерация контента на 9 языках и 18+ диалектах китайского языка (например, кантонский, шаньдунский) с сохранением идентичности спикера.
- Производственная озвучка с использованием функции 'pronunciation inpainting' для контроля произношения китайских пиньинь и английских фонем.
- Быстрый прототипинг голосовых интерфейсов через встроенный Gradio-интерфейс и API.
- Обучение кастомных моделей TTS с использованием скриптов для fine-tuning и RL-оптимизации.
Ключевые возможности
- Zero-shot multilingual voice cloning: поддержка 9 языков и кросс-лингвального клонирования голоса без дообучения.
- Bi-Streaming inference: поддержка потокового ввода текста и вывода аудио с задержкой около 150 мс.
- Instruct Support: управление характеристиками речи через инструкции (язык, диалект, эмоции, громкость, скорость).
- Text Normalization: встроенная обработка чисел, спецсимволов и сложных форматов текста без необходимости внешнего фронтенда.
- Поддержка оптимизаций: интеграция с vLLM, TensorRT-LLM (triton) и методы ускорения (KV cache, SDPA).
👤 Кому подойдёт: разработчики, исследователи в области NLP и speech synthesis, создатели голосовых интерфейсов и продуктов, требующих кастомизации речи.