Релиз модели21 июля 2026 г., 06:17 МСК🤖 Auto

Qwen-Audio-3.0-TTS: Новый лидер TTS от Alibaba с ценой $27.59/млн символов

Alibaba Tongyi Lab выпустила hosted-модель Qwen-Audio-3.0-TTS, занявшую первое место в рейтинге Artificial Analysis. Модель предлагает два режима (Flash и Plus), поддержку 16 языков и цену втрое ниже конкурентов.

Баннер новости 4003

Два режима для разных задач

Alibaba представила Qwen-Audio-3.0-TTS как production-ready решение, доступное только через API в Alibaba Cloud Model Studio. Архитектура разделена на два варианта:

  • Qwen-Audio-3.0-TTS-Flash: оптимизирован для real-time взаимодействия. Задержка первого пакета (first-packet latency) составляет около 300 мс. Идеален для чат-ботов и голосовых помощников.
  • Qwen-Audio-3.0-TTS-Plus: фокус на качестве генерации, естественности и верности тембра. Скорость генерации ниже (~16 символов/сек), но качество звука выше.

Обе модели работают через WebSocket, поддерживают стриминг, клонирование голоса и выводят аудио с частотой дискретизации до 48 кГц (форматы PCM, WAV, MP3, Opus).

Лидерство в бенчмарках и цена

Модель Plus заняла 1-е место в рейтинге Artificial Analysis Speech Arena для провайдерских голосов. Однако важно учитывать компромиссы: высокая точность достигается за счет пропускной способности. Ниже приведено сравнение ключевых метрик лидеров рынка:

Модель Рейтинг Elo Пропускная способность (симв/сек) Цена (за 1 млн символов)
Qwen-Audio-3.0-TTS-Plus ~1,236 ~16 $27.59
Simba 3.2 1,234 30.2 Информация недостаточна
Gemini 3.1 Flash TTS 1,214 27 Информация недостаточна
Sonic 3.5 1,207 120 Информация недостаточна

Ценовое преимущество Qwen-Plus очевидно: $27.59 за миллион символов составляет примерно треть от стоимости аналогичных услуг у ElevenLabs и MiniMax. При этом статистическая разница в рейтинге между Qwen-Plus и Simba 3.2 находится в пределах доверительного интервала, что делает их конкурентами на вершине.

Технические особенности и мультиязычность

В основе модели лежит 12.5 Hz low-frame-rate speech tokenizer, который снижает затраты на декодирование, сохраняя информацию о контенте и дикторе. Обучение проходило в пять этапов, включая reinforcement learning для LM и FM компонентов.

Модель поддерживает 16 языков (включая новые: индонезийский, малайский, тагальский, тайский, вьетнамский) и 20 китайских диалектов. По метрике ошибки распознавания слов/символов (WER/CER) Qwen показывает лучшие результаты в 10 из 16 языков:

  • Flash: средний WER/CER 3.87
  • Plus: средний WER/CER 3.96

По показателю сходства голоса (speaker similarity) Plus лидирует со средним баллом 82.75 против 80.44 у Flash.

Тонкий контроль через теги

Разработчики получили доступ к 86 встроенным тегам для управления невербальными элементами. Они делятся на:

  • Control tags: [excited], [sad], [whispers] — задают эмоцию до следующего тега.
  • Rich-language tags: [laughing], [gasp], [clears throat] — вставляют звуковой эффект в конкретную точку.

Пример использования: [excited]What a beautiful day today![laughing]Let's go out and have fun together!

Важное ограничение: использование тегов эмоций и звуковых эффектов доступно только в режиме одностороннего стриминга (unidirectional streaming).

Реакция сообщества и выводы

Релиз вызвал осторожный энтузиазм. Главные плюсы — доминирование в качестве при низкой цене и поддержка множества языков. Основные критические замечания касаются того, что модель является hosted-only (нет возможности скачать веса), а также более низкой пропускной способности по сравнению с Sonic 3.5. Модель не следует путать с open-source Qwen3-TTS (лицензия Apache-2.0), так как Qwen-Audio-3.0-TTS — это отдельная API-линейка.

Бенчмарки

БенчмаркQwen-Audio-3.0-TTS-FlashQwen-Audio-3.0-TTS-PlusGemini 3.1 Flash TTSSimba 3.2Sonic 3.5
WER/CER (Average)3.87%3.96%
Speaker Similarity (Average)80.44%82.75%
Artificial Analysis Elo1236Elo1214Elo1234Elo1207Elo

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗