Релиз модели25 сентября 2026 г., 15:47 МСК🤖 Auto

Qwen-Audio-3.1-TTS: Голос как у актера. Новый SOTA в синтезе речи

Alibaba Cloud представила Qwen-Audio-3.1-TTS — систему синтеза речи нового поколения, поддерживающую 16 языков, 20 китайских диалектов и тонкий контроль эмоций через текстовые инструкции.

Баннер новости 8268

Революция в контроле голоса

Alibaba Cloud выпустила Qwen-Audio-3.1-TTS, модель, которая переводит синтез речи из разряда технической функции в категорию творческого инструмента. Главная особенность системы — возможность управления голосом с точностью до актера. Пользователи могут задавать тон, эмоцию, темп и акцент как через свободные текстовые инструкции (например, «скажи это с раздражением»), так и через 86 новых встроенных тегов для локального контроля на уровне фраз и слов.

Модель поддерживает генерацию невербальных звуков: смеха, дыхания, кашля и вздохов, что делает речь максимально естественной. Также реализована поддержка синтеза длинных текстов объемом до 3 минут за один проход без потери качества.

Технические инновации: скорость и качество

В основе архитектуры лежит токенизатор речи с низкой частотой кадров (12.5 Hz), который значительно снижает вычислительные затраты при авторегрессионном декодировании, ускоряя инференс. Обучение модели проходило в пять этапов, включая предварительное обучение LM и FM, совместное обучение с аннеалингом данных, а также обучение с подкреплением (RL) для улучшения согласованности контента и просодической естественности.

Система демонстрирует высокую устойчивость к шуму: она корректно обрабатывает референсные аудиозаписи с эхом, фоновым шумом или нечеткой дикцией без необходимости явного режима шумоподавления.

Глобальное покрытие и диалекты

Qwen-Audio-3.1-TTS расширяет границы мультиязычности. Модель поддерживает 16 языков (семь из которых добавлены впервые) и 20 китайских диалектных регионов. Это включает такие языки, как арабский, индонезийский, португальский, тайский, вьетнамский, малайский и филиппинский, а также специфические китайские диалекты: чункинский, дунбэйский, кантонский, гуйчжоуский и другие.

Результаты бенчмарков

Модель показала state-of-the-art результаты в ряде метрик. На независимом рейтинге Artificial Analysis Text-to-Speech Leaderboard Qwen-Audio-3.1-TTS заняла первое место. В сравнении с конкурентами (CosyVoice 3.0-0.5B и 1.5B) модель демонстрирует превосходство в согласованности контента и схожести голоса, особенно в сложных задачах текстовой нормализации (HARD-ZH/EN) и кросс-лингвальной генерации.

Характеристика Qwen-Audio-3.1-TTS CosyVoice 3.0-0.5B CosyVoice 3.0-1.5B
Поддержка языков 16 (вкл. 7 новых) Меньше Меньше
Китайские диалекты 20 регионов Информация недостаточна Информация недостаточна
Длина синтеза До 3 минут (one-pass) Информация недостаточна Информация недостаточна
Частота токенизации 12.5 Hz (низкая задержка) Информация недостаточна Информация недостаточна
Позиция в Artificial Analysis #1 Ниже Ниже

Практическое применение

Система готова к продакшену. Она предлагает воспроизводимый протокол тонкой настройки голосов (speaker fine-tuning) и суперразрешение вокодера для вывода аудио в формате 48 kHz. Это делает Qwen-Audio-3.1-TTS мощным фундаментом для создания голосовых ассистентов, аудиокниг, дубляжа и интерактивных развлекательных продуктов.

Источник: Aliyuncs ↗