Релиз модели2 сентября 2026 г., 09:18 МСК🤖 Auto

Meta Muse Voice Transcribe: один модель для ASR, диаризации и endpointing

Meta Superintelligence Labs представила Muse Voice Transcribe — единую модель для потоковой расшифровки, распознавания говорящих и определения конца речи. Модель доступна через API по цене $3 за 1000 минут.

Баннер новости 6563

Архитектура: три задачи в одном autoregressive-модели

Традиционные голосовые стеки состоят из трех разрозненных систем: одна для транскрипции, вторая для разделения говорящих, третья для определения конца речи. Каждая передача данных между ними добавляет задержку и новые точки отказа. Meta Muse Voice Transcribe, выпущенная Meta Superintelligence Labs, объединяет все три функции в один autoregressive-модель. Это первый в своем роде модель для потоковой аудио-перцепции, которая выполняет потоковую ASR, диаризацию для 20+ говорящих и endpointing за один проход без необходимости постобработки.

Технические детали: адаптивная задержка и RL

Модель работает с аудио в виде 80-миллисекундных чанков с частотой 12.5 Гц. Каждый чанк преобразуется в один "мягкий токен". После каждого чанка модель принимает бинарное решение: либо предсказать токен <|next_audio|> и продолжить слушать, либо выдать текстовый токен. Когда поток заканчивается, вставляется токен , и модель завершает оставшийся текст без запроса дополнительного аудио.

Ключевая инновация — адаптивная задержка, обученная с помощью reinforcement learning (RL). Модель контролирует, сколько аудио-контекста находится за каждым словом, что позволяет варьировать задержку в зависимости от сложности слова. RL-политика оптимизирует компромисс между точностью (WER) и задержкой, помещая модель на Парето-фронт для скорости против точности.

Диаризация и endpointing через токены

Meta не добавляла вторую модель для атрибуции говорящих. Вместо этого были добавлены специальные токены в тот же поток:

  • Диаризация: токен <|start_of_turn|> отмечает потенциальное переключение говорящего, а тег идентифицирует говорящего. Токен поворота срабатывает, как только переключение возможно, а тег говорящего задерживается до конца чанка.
  • Endpointing: токен <|speech_onset|> отмечает начало речи, а <|speech_endpoint|> — точку, где пользователь закончил говорить. Обе задачи обучаются совместно с потоковой ASR с дополнительными наградами поверх награды ASR.

Производительность и бенчмарки

Модель обучена на 70+ языках, из которых 25 тщательно проверены и рекомендованы при запуске. Поддерживается нативный code-switching (переключение языков внутри предложения и между предложениями). Модель поддерживает ввод аудио длительностью более одного часа и распознавание 20+ говорящих без постобработки.

По данным Artificial Analysis (по состоянию на 1 сентября 2026 года), Muse Voice Transcribe занимает первое место в потоковой speech-to-text и на публичных бенчмарках диаризации:

Метрика Muse Voice Transcribe Cartesia Ink-2 (semantic) ElevenLabs Scribe v2 Cartesia Ink-2 (external)
Final WER 3.1% 3.4% 3.6% 4.0%
Задержка после конца речи 0.16s 0.43s 0.14s 0.07s
First Partial WER 3.6% @ 0.13s - - -
Diаризация (DER) 17.5% 21.1% - 28.6% 21.1% - 28.6% 21.1% - 28.6%

Доступность и цена

Модель доступна только как хостинговый API через Meta Model API под именем muse-voice-transcribe-1.0. Вес модели не опубликован, поэтому самостоятельное развертывание невозможно. Цена составляет $3.00 за 1000 аудио-минут ($0.18 за час), что дешевле Cartesia Ink-2 ($4.00) и менее чем вдвое дешевле ElevenLabs Scribe v2 Realtime и Deepgram Flux ($6.50). Модель уже используется для диктовки в Meta AI для Mac и Muse Code.

Источник: MarkTechPost ↗