Релиз модели29 сентября 2026 г., 09:17 МСК🤖 Auto

Qwen-Audio-3.1: Полнодуплексный голосовой AI от Alibaba с ценой ниже рынка

Alibaba Qwen выпустила модель Qwen-Audio-3.1-Realtime для голосовых агентов с контекстом 262K токенов и снижением цен на 85%. Модель обучена самостоятельно принимать решения о том, когда говорить, а когда слушать.

Баннер новости 8485

Архитектура: Три слоя обучения

Новая модель Qwen-Audio-3.1-Realtime работает в режиме full-duplex (полный дуплекс), позволяя пользователю и ИИ говорить одновременно. Архитектура базируется на двух моделях с общим аудиоэнкодером и LLM. Обучение разделено на три ключевых этапа:

  • Think (Мысли): Используется метод M²-OPD и on-policy distillation. Модель учится не просто копировать ответы, а оценивать собственные траектории с помощью текстового учителя и замороженного аудио-референса. Применяется GRPO для обучения эмпатии и прагматическим намерениям.
  • Act (Действуй): Интеграция с исполняемыми средами. Модель работает с пулами инструментов и JSON-базами данных. Награда (reward) начисляется за успешное выполнение задач, а не за красивую формулировку. Это позволило снизить количество избыточных запросов к поиску с 4.37 до 1.05.
  • Speak and Coordinate (Говори и координируй): Отдельный модуль решает, когда прерывать собеседника, а когда молчать. На бенчмарке Full-Duplex-Bench v1.5 частота ответов на фоновую речь упала с 0.13 до 0.03.

Ценообразование и доступность

Alibaba значительно снизила стоимость использования модели по сравнению с предыдущими версиями и конкурентами. Модель доступна только через API на QwenCloud (qwen-audio-3.1-realtime-plus), открытые веса не опубликованы.

Параметр Qwen-Audio-3.1-Realtime-Plus OpenAI GPT-Realtime-2 Google Gemini 3.8 Live
Входной аудио / 1M токенов $6.4 $32 $3.00
Выходной (текст+аудио) / 1M токенов $24 $64 $12.00
Контекстное окно 262K токенов 128K токенов 131,072 токенов
Макс. вывод 16K токенов 32K токенов 65,536 токенов
Встроенный веб-поиск Да Не указан Google Search grounding

Результаты бенчмарков

Модель демонстрирует значительный прогресс по сравнению с версией 3.0, особенно в задачах распознавания речи и многоязычности. Однако в тестах на человеческую оценку (human red-team) она пока уступает лидеру рынка.

Метрика Результат Qwen-Audio-3.1 Результат Qwen-Audio-3.0
Audio MultiChallenge 52.21 47.12
BBA (14 языков, среднее) 88.1% 81.7%
FLEURS WER (ошибка распознавания) 3.98 9.01
Успешность задач (τ-Voice адаптация) 82.0% 78.4%
Успешность атак (Multi-turn, EN) 23.5% Информация недостаточна

Почему это важно

Снижение цены на входной аудио-токен до $6.4 (против $32 у OpenAI) делает Qwen-Audio-3.1 крайне привлекательным для коммерческих голосовых агентов, работающих с большим объемом входящего звука. Увеличение контекстного окна до 262K токенов позволяет моделям помнить длинные диалоги, что критично для сложных сценариев поддержки клиентов. Несмотря на то, что GPT-Realtime-2 все еще лидирует в тестах на естественность общения (96% против 92% у Qwen), разрыв сокращается, а ценовое преимущество Alibaba становится решающим фактором для разработчиков.

Бенчмарки

БенчмаркQwen-Audio-3.1-Realtime-Plus (Chinese)Qwen-Audio-3.1-Realtime-Plus (English)
Multi-turn attack success26%23.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗