Два режима для разных задач
Alibaba представила Qwen-Audio-3.0-TTS как production-ready решение, доступное только через API в Alibaba Cloud Model Studio. Архитектура разделена на два варианта:
- Qwen-Audio-3.0-TTS-Flash: оптимизирован для real-time взаимодействия. Задержка первого пакета (first-packet latency) составляет около 300 мс. Идеален для чат-ботов и голосовых помощников.
- Qwen-Audio-3.0-TTS-Plus: фокус на качестве генерации, естественности и верности тембра. Скорость генерации ниже (~16 символов/сек), но качество звука выше.
Обе модели работают через WebSocket, поддерживают стриминг, клонирование голоса и выводят аудио с частотой дискретизации до 48 кГц (форматы PCM, WAV, MP3, Opus).
Лидерство в бенчмарках и цена
Модель Plus заняла 1-е место в рейтинге Artificial Analysis Speech Arena для провайдерских голосов. Однако важно учитывать компромиссы: высокая точность достигается за счет пропускной способности. Ниже приведено сравнение ключевых метрик лидеров рынка:
| Модель | Рейтинг Elo | Пропускная способность (симв/сек) | Цена (за 1 млн символов) |
|---|---|---|---|
| Qwen-Audio-3.0-TTS-Plus | ~1,236 | ~16 | $27.59 |
| Simba 3.2 | 1,234 | 30.2 | Информация недостаточна |
| Gemini 3.1 Flash TTS | 1,214 | 27 | Информация недостаточна |
| Sonic 3.5 | 1,207 | 120 | Информация недостаточна |
Ценовое преимущество Qwen-Plus очевидно: $27.59 за миллион символов составляет примерно треть от стоимости аналогичных услуг у ElevenLabs и MiniMax. При этом статистическая разница в рейтинге между Qwen-Plus и Simba 3.2 находится в пределах доверительного интервала, что делает их конкурентами на вершине.
Технические особенности и мультиязычность
В основе модели лежит 12.5 Hz low-frame-rate speech tokenizer, который снижает затраты на декодирование, сохраняя информацию о контенте и дикторе. Обучение проходило в пять этапов, включая reinforcement learning для LM и FM компонентов.
Модель поддерживает 16 языков (включая новые: индонезийский, малайский, тагальский, тайский, вьетнамский) и 20 китайских диалектов. По метрике ошибки распознавания слов/символов (WER/CER) Qwen показывает лучшие результаты в 10 из 16 языков:
- Flash: средний WER/CER 3.87
- Plus: средний WER/CER 3.96
По показателю сходства голоса (speaker similarity) Plus лидирует со средним баллом 82.75 против 80.44 у Flash.
Тонкий контроль через теги
Разработчики получили доступ к 86 встроенным тегам для управления невербальными элементами. Они делятся на:
- Control tags: [excited], [sad], [whispers] — задают эмоцию до следующего тега.
- Rich-language tags: [laughing], [gasp], [clears throat] — вставляют звуковой эффект в конкретную точку.
Пример использования: [excited]What a beautiful day today![laughing]Let's go out and have fun together!
Важное ограничение: использование тегов эмоций и звуковых эффектов доступно только в режиме одностороннего стриминга (unidirectional streaming).
Реакция сообщества и выводы
Релиз вызвал осторожный энтузиазм. Главные плюсы — доминирование в качестве при низкой цене и поддержка множества языков. Основные критические замечания касаются того, что модель является hosted-only (нет возможности скачать веса), а также более низкой пропускной способности по сравнению с Sonic 3.5. Модель не следует путать с open-source Qwen3-TTS (лицензия Apache-2.0), так как Qwen-Audio-3.0-TTS — это отдельная API-линейка.
Бенчмарки
| Бенчмарк | Qwen-Audio-3.0-TTS-Flash | Qwen-Audio-3.0-TTS-Plus | Gemini 3.1 Flash TTS | Simba 3.2 | Sonic 3.5 |
|---|---|---|---|---|---|
| WER/CER (Average) | 3.87% | 3.96% | — | — | — |
| Speaker Similarity (Average) | 80.44% | 82.75% | — | — | — |
| Artificial Analysis Elo | — | 1236Elo | 1214Elo | 1234Elo | 1207Elo |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
