Технические характеристики и скорость
Alibaba Cloud выпустила новую модель Qwen3.8-LiveTranslate, предназначенную для обработки речи в реальном времени. Ключевое улучшение касается задержки: система сократила время отклика с 2,8 до 2,3 секунды. Это позволяет вести диалоги с минимальными паузами, делая перевод практически синхронным.
Модель выполняет три задачи одновременно: распознает исходную речь, переводит её и генерирует аудиовыход. При этом поддерживается клонирование голоса — перевод озвучивается тем же тембром, что и у оригинального говорящего, что критически важно для сохранения эмоциональной окраски беседы.
Работа с несколькими собеседниками и контекстом
Значительное обновление касается сценариев с несколькими участниками. Qwen3.8-LiveTranslate умеет:
- Различать голоса разных собеседников;
- Подписывать, кто именно произносит реплику;
- Сохранять индивидуальную голосовую окраску каждого участника при синтезе перевода.
Кроме того, модель учитывает визуальный контекст. Изображения, жесты или текст в кадре используются для уточнения перевода имен, терминов и неоднозначных фраз, повышая точность в сложных ситуациях.
Языковая поддержка и доступность
Система поддерживает распознавание 60 языков. Для 29 из них доступна функция TTS (text-to-speech) — модель выдает не только текст, но и озвученный перевод. Русский язык входит в этот список, что делает инструмент применимым для широкой аудитории.
Сравнение возможностей
| Параметр | Значение / Возможность |
|---|---|
| Задержка (Latency) | 2,3 секунды (улучшено с 2,8 с) |
| Количество языков распознавания | 60 языков |
| Языки с озвучкой (TTS) | 29 языков (включая русский) |
| Мультиспикер | Да (разделение и подпись говорящих) |
| Визуальный контекст | Да (учет жестов, текста в кадре) |
| Доступ | API Qwen |
Почему это важно
Снижение задержки и добавление функции клонирования голоса решают главную проблему предыдущих поколений нейросетевых переводчиков — искусственность и разрыв в темпе общения. Интеграция визуального контекста открывает новые возможности для перевода сложных технических или культурных диалогов, где слова без картинки могут быть неоднозначны. Модель уже доступна через API Qwen.
Источник: Qwen ↗
