Релиз модели19 сентября 2026 г., 15:46 МСК🤖 Auto

Qwen3.8-LiveTranslate: синхронный перевод с сохранением голоса и контекстом

Alibaba представила Qwen3.8-LiveTranslate — модель для почти синхронного перевода речи, сократившая задержку до 2,3 секунды и добавившая функцию клонирования голоса и учета визуального контекста.

Баннер новости 7863

Технические характеристики и скорость

Alibaba Cloud выпустила новую модель Qwen3.8-LiveTranslate, предназначенную для обработки речи в реальном времени. Ключевое улучшение касается задержки: система сократила время отклика с 2,8 до 2,3 секунды. Это позволяет вести диалоги с минимальными паузами, делая перевод практически синхронным.

Модель выполняет три задачи одновременно: распознает исходную речь, переводит её и генерирует аудиовыход. При этом поддерживается клонирование голоса — перевод озвучивается тем же тембром, что и у оригинального говорящего, что критически важно для сохранения эмоциональной окраски беседы.

Работа с несколькими собеседниками и контекстом

Значительное обновление касается сценариев с несколькими участниками. Qwen3.8-LiveTranslate умеет:

  • Различать голоса разных собеседников;
  • Подписывать, кто именно произносит реплику;
  • Сохранять индивидуальную голосовую окраску каждого участника при синтезе перевода.

Кроме того, модель учитывает визуальный контекст. Изображения, жесты или текст в кадре используются для уточнения перевода имен, терминов и неоднозначных фраз, повышая точность в сложных ситуациях.

Языковая поддержка и доступность

Система поддерживает распознавание 60 языков. Для 29 из них доступна функция TTS (text-to-speech) — модель выдает не только текст, но и озвученный перевод. Русский язык входит в этот список, что делает инструмент применимым для широкой аудитории.

Сравнение возможностей

Параметр Значение / Возможность
Задержка (Latency) 2,3 секунды (улучшено с 2,8 с)
Количество языков распознавания 60 языков
Языки с озвучкой (TTS) 29 языков (включая русский)
Мультиспикер Да (разделение и подпись говорящих)
Визуальный контекст Да (учет жестов, текста в кадре)
Доступ API Qwen

Почему это важно

Снижение задержки и добавление функции клонирования голоса решают главную проблему предыдущих поколений нейросетевых переводчиков — искусственность и разрыв в темпе общения. Интеграция визуального контекста открывает новые возможности для перевода сложных технических или культурных диалогов, где слова без картинки могут быть неоднозначны. Модель уже доступна через API Qwen.

Источник: Qwen ↗