QwenAudio/CosyVoice

Многоязычная большая модель генерации голоса, обеспечивающая полный стек возможностей для инференса, обучения и развертывания.

Аудио⭐ 23 724Pythonпоследний релиз: v2.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

CosyVoice — это открытая модель синтеза речи (TTS) на базе больших языковых моделей (LLM), поддерживающая генерацию голоса на нескольких языках с возможностью клонирования без предварительного обучения (zero-shot).

Зачем нужен

Инструмент решает задачу высококачественной генерации естественной речи из текста, обеспечивая высокую консистентность контента и сходство с целевым голосом. Он полезен для создания голосовых ассистентов, аудиокниг и интерактивных приложений, так как поддерживает потоковую передачу с низкой задержкой и тонкую настройку параметров (эмоции, скорость, диалекты).

Что можно реализовать

  • Создание голосовых ассистентов с поддержкой потоковой генерации (latency ~150ms) для интерактивного общения.
  • Генерация контента на 9 языках и 18+ диалектах китайского языка (например, кантонский, шаньдунский) с сохранением идентичности спикера.
  • Производственная озвучка с использованием функции 'pronunciation inpainting' для контроля произношения китайских пиньинь и английских фонем.
  • Быстрый прототипинг голосовых интерфейсов через встроенный Gradio-интерфейс и API.
  • Обучение кастомных моделей TTS с использованием скриптов для fine-tuning и RL-оптимизации.

Ключевые возможности

  • Zero-shot multilingual voice cloning: поддержка 9 языков и кросс-лингвального клонирования голоса без дообучения.
  • Bi-Streaming inference: поддержка потокового ввода текста и вывода аудио с задержкой около 150 мс.
  • Instruct Support: управление характеристиками речи через инструкции (язык, диалект, эмоции, громкость, скорость).
  • Text Normalization: встроенная обработка чисел, спецсимволов и сложных форматов текста без необходимости внешнего фронтенда.
  • Поддержка оптимизаций: интеграция с vLLM, TensorRT-LLM (triton) и методы ускорения (KV cache, SDPA).

👤 Кому подойдёт: разработчики, исследователи в области NLP и speech synthesis, создатели голосовых интерфейсов и продуктов, требующих кастомизации речи.

Релизы