В мире искусственного интеллекта, где гонка за производительностью не затихает ни на секунду, компания Alibaba продолжает демонстрировать, что может конкурировать с ведущими мировыми игроками не только в области текстовых моделей, но и в сложных мультимодальных задачах. Недавно команда Qwen представила Qwen-Audio-3.1 — амбициозный стек из пяти моделей, охватывающий распознавание речи (ASR), синтез речи (TTS) и, что самое важное, взаимодействие в реальном времени. Это не просто еще один апдейт; это шаг к созданию по-настоящему «агентных» голосовых помощников, которые умеют не только говорить, но и думать, действовать и принимать решения о том, когда именно нужно вступить в диалог.
Центральным элементом этого релиза стала модель Qwen-Audio-3.1-Realtime. Она разработана специально для голосовых агентов, которые должны вызывать внешние инструменты (function calling) в режиме реального времени. Но самое интересное происходит за кулисами: Alibaba не только улучшила качество, но и радикально снизила цены. Стоимость использования модели Realtime упала примерно на 85%, TTS — на 70%, а ASR — до 95%. Это делает технологию доступной для широкого круга разработчиков и бизнеса.
В этой статье мы подробно разберем, как устроена эта система, какие инновационные методы обучения она использует, как она справляется с прерываниями и фоновым шумом, и что все это значит для разработчиков, работающих с голосовыми интерфейсами. Мы также рассмотрим сравнительный анализ с конкурентами, такими как GPT-Realtime-2 от OpenAI и Gemini Live от Google, чтобы понять место Qwen-Audio-3.1 в текущей экосистеме AI.
01Доступность и развертывание: API, а не веса
Первый вопрос, который возникает у любого разработчика при выходе новой модели: «Могу ли я запустить её локально?». В случае с Qwen-Audio-3.1 ответ однозначен — на данный момент открытые веса (open weights) не опубликованы. Модель доступна исключительно через управляемый API на платформе QwenCloud по протоколу WebSocket. Это стандартная практика для самых передовых моделей, требующих огромных вычислительных ресурсов, но это также означает, что для интеграции вам потребуется стабильное интернет-соединение и учетная запись в облаке Alibaba.
Модель, доступная для использования, называется qwen-audio-3.1-realtime-plus. Она поддерживает как текстовый, так и аудио ввод, а также генерирует оба типа вывода. Контекстное окно модели составляет впечатляющие 262 000 токенов, из которых до 245 000 может быть использовано для ввода, а до 16 000 — для вывода. Это позволяет модели помнить очень длинные диалоги, что критически важно для сложных многошаговых задач.
Для разработчиков важно знать и лимиты: по умолчанию доступно 60 запросов в минуту и 100 000 токенов в минуту. Это достаточно щедрые ограничения для большинства приложений, но при высокой нагрузке их стоит мониторить.
qwen-audio-3.1-realtime-plus. Это обеспечит минимальную задержку и позволит обрабатывать аудиопоток в реальном времени, что критично для полнодуплексного общения, где пользователь может перебивать бота.02Архитектура: Два двигателя в одном голосовом агенте
Чтобы понять, как Qwen-Audio-3.1 достигает таких результатов, нужно заглянуть под капот. Система построена на двух основных моделях, которые разделяют один и тот же аудиоэнкодер и архитектуру большой языковой модели (LLM). Это элегантное решение позволяет эффективно использовать вычислительные ресурсы.

Первая модель — это полнодуплексная модель принятия решений. Её задача — анализировать контекст разговора и предсказывать, должен ли агент продолжать слушать, начать говорить, остановиться или возобновить речь. Это «мозг», отвечающий за управление очередью речи (turn-taking). Вторая модель — это модель преобразования речи в текст (STT), которая транскрибирует ответ агента. Затем, третий компонент, голосовой рендерер, преобразует этот текст обратно в поток аудио, учитывая историю разговора, голосовые нюансы и акустический контекст. Такая трехуровневая архитектура (Think, Act, Speak) обеспечивает естественность и плавность диалога.
03Обучение в три этапа: Think, Act, Speak
Ключ к успеху Qwen-Audio-3.1 кроется в её методологии обучения, которая разделена на три четких слоя. Это не просто сбор данных, а сложная система дистилляции и обучения с подкреплением.
1. Think: M²-OPD и контекстуализация
На этапе «Think» используется метод M²-OPD (Multimodality On-Policy Distillation). Процесс начинается с «Core-Cocktail SFT» (Supervised Fine-Tuning), который привязывает аудио-модель обратно к её текстовому источнику (LLM) с использованием миллионов пар данных. Затем применяется мультимодальная OPD. Здесь используется подход «Text Teacher» и замороженный «Audio Reference», которые оценивают каждый токен траектории студента. Важно отметить, что это on-policy дистилляция, а не простое копирование заранее написанных ответов. Модель учится рассуждать на основе собственного опыта.
Далее в процесс включаются эксперты по эмпатии, прагматическим намерениям и акустическим сценам, которые обучаются с помощью алгоритма GRPO (Group Relative Policy Optimization). Мульти-учительская OPD объединяет их в одну развертываемую модель, делая её более эмпатичной и контекстуально осведомленной.
2. Act: Исполняемые среды и вызов инструментов
Этап «Act» посвящен способности модели выполнять действия. Каждая обучающая доменная область содержит пул инструментов, состояние JSON-базы данных и естественные языковые бизнес-политики. Домены формируются на основе определений инструментов с открытым исходным кодом и серверов MCP (Model Context Protocol).
Каждая задача определяет один из трех исходов: запись данных, обоснованный отказ или запрос, который система не может выполнить. Оценка проверяет конечное состояние, разрешенные записи и поведенческие утверждения. Важно, что беглый ответ не спасет модель, если проверка состояния провалена. Это заставляет модель быть честной и точной в своих действиях.

Обучение с подкреплением GRPO получает награды на уровне диалога, вех и поворотов. Особое внимание уделено оптимизации поисковых запросов. Штраф за избыточные запросы рассчитывается по формуле:
r_query = q * min(1, n_ref / n_pred)Результаты впечатляют: среднее количество запросов на один вызов поиска упало с 4,37 до 1,05. Хотя F1-мера триггера немного снизилась с 60,87% до 58,61%, общая эффективность системы значительно возросла за счет экономии ресурсов и скорости.
3. Speak and Coordinate: Управление очередью речи
Третий слой отвечает за то, когда и как говорить. На бенчмарке Full-Duplex-Bench v1.5 количество ответов на речь людей, разговаривающих с кем-то другим (фоновый шум), упало с 0,13 до 0,03. На версии v3.0 уровень заполнителей (filler rate, например, «э-э», «ммм») снизился с 0,7590 до 0,2960. Это делает речь более чистой и профессиональной.
Однако есть и компромиссы. После прерываний уровень нежелательного возобновления речи вырос с 0,035 до 0,130. Задержка остановки при прерывании составляет 1,116 секунды, что медленнее, чем у GPT-Realtime-2 (0,383 секунды). Это область для дальнейших улучшений, но текущие результаты уже очень конкурентоспособны.
04Сопутствующая модель: Qwen-Audio-3.1-ASR-Flash-Filetrans
Помимо основной модели реального времени, Alibaba выпустила Qwen-Audio-3.1-ASR-Flash-Filetrans. Эта модель ориентирована на офлайн-транскрипцию длинных аудиофайлов. Она поддерживает горячие слова (hot words), разделение говорящих, пунктуацию, многоязычность и распознавание китайских диалектов. Стоимость использования: $0,15 за 1 млн токенов ввода и $0,47 за вывод. Это отличное решение для задач архивации, субтитрирования и анализа записей встреч.
05Сравнение с конкурентами: Qwen против GPT и Gemini
Чтобы оценить место Qwen-Audio-3.1 на рынке, давайте сравним её с лидерами: OpenAI GPT-Realtime-2 и Google Gemini 3.8 Live. Данные основаны на открытых источниках по состоянию на 28 сентября 2026 года.

| Функция | Qwen-Audio-3.1-Realtime-Plus | OpenAI GPT-Realtime-2 | Google Gemini 3.8 Live |
|---|---|---|---|
| Ввод | Текст, аудио | Текст, аудио | Текст, изображения, аудио, видео |
| Вывод | Текст, аудио | Текст, аудио | Текст и аудио |
| Контекст / лимит ввода | 262K | 128K | 131,072 |
| Макс. вывод | 16K | 32K | 65,536 |
| Вызов функций (Function Calling) | Да | Да | Да (по умолчанию асинхронно) |
| Встроенный веб-поиск | Да | Не указан | Google Search grounding |
| Рассуждение (Reasoning) | Thinking mode, макс. 2K рассуждений | Настраиваемые усилия | Промежуточное рассуждение |
| Аудио ввод / 1 млн токенов | $6.4 | $32 | $3.00 |
| Аудио вывод / 1 млн токенов | $24 (текст и аудио) | $64 | $12.00 |
| Открытые веса | Нет | Нет | Нет |
Как видно из таблицы, Qwen-Audio-3.1 предлагает один из самых больших контекстных окон (262K) среди конкурентов, что дает преимущество в долгосрочных диалогах. По цене аудио-ввода она значительно дешевле GPT-Realtime-2 ($6.4 против $32), хотя и немного дороже Gemini ($3.00). Однако, Gemini поддерживает ввод видео и изображений, чего Qwen пока не делает. GPT-Realtime-2 все еще лидирует в исследовании «красной команды» с участием людей (96,00% против 92,00% у Qwen), что указывает на более высокую естественность общения в сложных сценариях.
06Результаты бенчмарков
Qwen-Audio-3.1 демонстрирует значительный прогресс по сравнению с версией 3.0. На Audio MultiChallenge балл вырос с 47,12 до 52,21. Средний показатель BBA для 14 языков поднялся с 81,7% до 88,1%. Ошибка распознавания слов (WER) на FLEURS снизилась с 9,01 до 3,98, что говорит о высокой точности транскрипции.
На адаптации τ-Voice успех задач вырос с 78,4% до 82,0%. Важно отметить, что цифры τ-Voice используют адаптацию речи в текст с полудуплексным режимом, поэтому они не являются прямым сравнением с официальными результатами полнодуплексных моделей. Тем не менее, это показывает общую улучшенную способность модели понимать и реагировать на речь.
07Безопасность и устойчивость к атакам
В эпоху, когда безопасность AI выходит на первый план, Qwen-Audio-3.1 показывает хорошие результаты в защите от вредоносных запросов. Успешность многошаговых атак снизилась до 26,0% на китайском языке и 23,5% на английском. Это означает, что модель лучше распознает попытки манипуляции и реже выполняет вредоносные инструкции, что критично для корпоративного использования.
08Что это значит на практике
Для разработчиков и бизнеса релиз Qwen-Audio-3.1 открывает новые возможности. Снижение цен делает голосовых агентов экономически выгодными для массового внедрения. Вы можете создать голосового помощника для колл-центра, который не только отвечает на вопросы, но и выполняет действия: бронирует билеты, обновляет CRM-систему или ищет информацию в интернете, используя встроенный веб-поиск.
Большое контекстное окно позволяет строить сложные сценарии, где бот помнит детали разговора, начатые несколько часов или даже дней назад. Интеграция с инструментами через GRPO-обучение означает, что агенты будут действовать более предсказуемо и безопасно, избегая ошибок в критических операциях.
Однако, если вам критически важна минимальная задержка при прерывании или поддержка видео-ввода, возможно, стоит рассмотреть Gemini Live. Но если вам нужен баланс между ценой, контекстом и функциональностью голосового агента, Qwen-Audio-3.1 является одним из лучших выборов на рынке сегодня.
Alibaba продолжает укреплять свои позиции в области AI, предлагая мощные инструменты, доступные для разработчиков по всему миру. Следите за обновлениями QwenCloud, так как эта платформа может стать ключевой инфраструктурой для следующего поколения голосовых приложений.
Источник: MarkTechPost ↗
