Революция в контроле голоса
Alibaba Cloud выпустила Qwen-Audio-3.1-TTS, модель, которая переводит синтез речи из разряда технической функции в категорию творческого инструмента. Главная особенность системы — возможность управления голосом с точностью до актера. Пользователи могут задавать тон, эмоцию, темп и акцент как через свободные текстовые инструкции (например, «скажи это с раздражением»), так и через 86 новых встроенных тегов для локального контроля на уровне фраз и слов.
Модель поддерживает генерацию невербальных звуков: смеха, дыхания, кашля и вздохов, что делает речь максимально естественной. Также реализована поддержка синтеза длинных текстов объемом до 3 минут за один проход без потери качества.
Технические инновации: скорость и качество
В основе архитектуры лежит токенизатор речи с низкой частотой кадров (12.5 Hz), который значительно снижает вычислительные затраты при авторегрессионном декодировании, ускоряя инференс. Обучение модели проходило в пять этапов, включая предварительное обучение LM и FM, совместное обучение с аннеалингом данных, а также обучение с подкреплением (RL) для улучшения согласованности контента и просодической естественности.
Система демонстрирует высокую устойчивость к шуму: она корректно обрабатывает референсные аудиозаписи с эхом, фоновым шумом или нечеткой дикцией без необходимости явного режима шумоподавления.
Глобальное покрытие и диалекты
Qwen-Audio-3.1-TTS расширяет границы мультиязычности. Модель поддерживает 16 языков (семь из которых добавлены впервые) и 20 китайских диалектных регионов. Это включает такие языки, как арабский, индонезийский, португальский, тайский, вьетнамский, малайский и филиппинский, а также специфические китайские диалекты: чункинский, дунбэйский, кантонский, гуйчжоуский и другие.
Результаты бенчмарков
Модель показала state-of-the-art результаты в ряде метрик. На независимом рейтинге Artificial Analysis Text-to-Speech Leaderboard Qwen-Audio-3.1-TTS заняла первое место. В сравнении с конкурентами (CosyVoice 3.0-0.5B и 1.5B) модель демонстрирует превосходство в согласованности контента и схожести голоса, особенно в сложных задачах текстовой нормализации (HARD-ZH/EN) и кросс-лингвальной генерации.
| Характеристика | Qwen-Audio-3.1-TTS | CosyVoice 3.0-0.5B | CosyVoice 3.0-1.5B |
|---|---|---|---|
| Поддержка языков | 16 (вкл. 7 новых) | Меньше | Меньше |
| Китайские диалекты | 20 регионов | Информация недостаточна | Информация недостаточна |
| Длина синтеза | До 3 минут (one-pass) | Информация недостаточна | Информация недостаточна |
| Частота токенизации | 12.5 Hz (низкая задержка) | Информация недостаточна | Информация недостаточна |
| Позиция в Artificial Analysis | #1 | Ниже | Ниже |
Практическое применение
Система готова к продакшену. Она предлагает воспроизводимый протокол тонкой настройки голосов (speaker fine-tuning) и суперразрешение вокодера для вывода аудио в формате 48 kHz. Это делает Qwen-Audio-3.1-TTS мощным фундаментом для создания голосовых ассистентов, аудиокниг, дубляжа и интерактивных развлекательных продуктов.
Источник: Aliyuncs ↗
