Архитектура: Три слоя обучения
Новая модель Qwen-Audio-3.1-Realtime работает в режиме full-duplex (полный дуплекс), позволяя пользователю и ИИ говорить одновременно. Архитектура базируется на двух моделях с общим аудиоэнкодером и LLM. Обучение разделено на три ключевых этапа:
- Think (Мысли): Используется метод M²-OPD и on-policy distillation. Модель учится не просто копировать ответы, а оценивать собственные траектории с помощью текстового учителя и замороженного аудио-референса. Применяется GRPO для обучения эмпатии и прагматическим намерениям.
- Act (Действуй): Интеграция с исполняемыми средами. Модель работает с пулами инструментов и JSON-базами данных. Награда (reward) начисляется за успешное выполнение задач, а не за красивую формулировку. Это позволило снизить количество избыточных запросов к поиску с 4.37 до 1.05.
- Speak and Coordinate (Говори и координируй): Отдельный модуль решает, когда прерывать собеседника, а когда молчать. На бенчмарке Full-Duplex-Bench v1.5 частота ответов на фоновую речь упала с 0.13 до 0.03.
Ценообразование и доступность
Alibaba значительно снизила стоимость использования модели по сравнению с предыдущими версиями и конкурентами. Модель доступна только через API на QwenCloud (qwen-audio-3.1-realtime-plus), открытые веса не опубликованы.
| Параметр | Qwen-Audio-3.1-Realtime-Plus | OpenAI GPT-Realtime-2 | Google Gemini 3.8 Live |
|---|---|---|---|
| Входной аудио / 1M токенов | $6.4 | $32 | $3.00 |
| Выходной (текст+аудио) / 1M токенов | $24 | $64 | $12.00 |
| Контекстное окно | 262K токенов | 128K токенов | 131,072 токенов |
| Макс. вывод | 16K токенов | 32K токенов | 65,536 токенов |
| Встроенный веб-поиск | Да | Не указан | Google Search grounding |
Результаты бенчмарков
Модель демонстрирует значительный прогресс по сравнению с версией 3.0, особенно в задачах распознавания речи и многоязычности. Однако в тестах на человеческую оценку (human red-team) она пока уступает лидеру рынка.
| Метрика | Результат Qwen-Audio-3.1 | Результат Qwen-Audio-3.0 |
|---|---|---|
| Audio MultiChallenge | 52.21 | 47.12 |
| BBA (14 языков, среднее) | 88.1% | 81.7% |
| FLEURS WER (ошибка распознавания) | 3.98 | 9.01 |
| Успешность задач (τ-Voice адаптация) | 82.0% | 78.4% |
| Успешность атак (Multi-turn, EN) | 23.5% | Информация недостаточна |
Почему это важно
Снижение цены на входной аудио-токен до $6.4 (против $32 у OpenAI) делает Qwen-Audio-3.1 крайне привлекательным для коммерческих голосовых агентов, работающих с большим объемом входящего звука. Увеличение контекстного окна до 262K токенов позволяет моделям помнить длинные диалоги, что критично для сложных сценариев поддержки клиентов. Несмотря на то, что GPT-Realtime-2 все еще лидирует в тестах на естественность общения (96% против 92% у Qwen), разрыв сокращается, а ценовое преимущество Alibaba становится решающим фактором для разработчиков.
Бенчмарки
| Бенчмарк | Qwen-Audio-3.1-Realtime-Plus (Chinese) | Qwen-Audio-3.1-Realtime-Plus (English) |
|---|---|---|
| Multi-turn attack success | 26% | 23.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
