Релиз модели2 сентября 2026 г., 13:46 МСК🤖 Auto

Meta представила Muse Voice Transcribe: прорыв в реальном времени

Meta Superintelligence Labs анонсировала Muse Voice Transcribe — первую модель восприятия аудио в реальном времени, способную транскрибировать речь 8+ спикеров с переключением языков.

Баннер новости 6583

Техническое превосходство и бенчмарки

Muse Voice Transcribe позиционируется как первый в своем роде модельный ряд от Meta Superintelligence Labs, ориентированный на обработку аудио в режиме реального времени (real-time). Ключевые технические характеристики включают:

  • Streaming ASR: потоковая транскрипция речи в текст.
  • Diarization: идентификация и разделение говорящих (до 20+ спикеров одновременно).
  • Endpointing: точное определение начала и конца фраз в потоке.

Модель демонстрирует лидерские позиции на платформе Artificial Analysis по метрикам потоковой передачи речи в текст (streaming speech-to-text) и на публичных бенчмарках диаризации. Рейтинг актуален на 1 сентября 2026 года.

Мультиязычность и Code-Switching

В отличие от многих конкурентов, Muse Voice Transcribe нативно поддерживает более 25 языков и, что критически важно, обеспечивает бесшовное переключение кодов (code-switching) внутри одного предложения. Это позволяет модели корректно обрабатывать смешанные языковые конструкции, характерные для реальных разговоров (например, смесь русского и английского), что является ключевым требованием для создания «персонального» ИИ.

Контекстное смещение (Context Biasing)

Модель использует механизм biasing для повышения точности распознавания специфических терминов. Система обучается учитывать личные контакты, ключевые слова пользователя и географические контексты (например, правильно распознавать названия мест вроде «Menlo Park» или бренды вроде «Meta» в контексте конкретного пользователя).

Демонстрация: 8 спикеров в реальном времени

Для демонстрации возможностей модели был проведен тест с участием 8 человек, говорящих одновременно в одной комнате. Модель успешно разделила потоки речи, определив, кто именно произносит каждую фразу, с минимальной задержкой. Это доказывает жизнеспособность технологии для сложных сценариев с перекрытием голосов и акцентами.

Характеристика Значение / Описание
Разработчик Meta Superintelligence Labs
Основная функция Real-time Audio Perception (ASR + Diarization)
Количество спикеров До 20+ (демонстрация на 8 спикерах)
Поддержка языков 25+ языков с бесшовным code-switching
Позиция в рейтингах #1 на Artificial Analysis (по состоянию на 01.09.2026)
Ключевая фича Context Biasing (учет личных данных и терминов)

Философия «Персонального Суперинтеллекта»

Запуск Muse Voice Transcribe вписывается в стратегию Марка Цукерберга о создании «персонального суперинтеллекта» (personal superintelligence). Идея заключается в том, что ИИ должен работать как «уши» для AI-очков или носимых устройств, слушая реальные, а не структурированные голосовые команды. Это позволяет ИИ становиться инструментом творчества и обучения, а не просто автоматизации, обеспечивая доступ к технологиям для каждого пользователя индивидуально.

Источник: Meta ↗