Архитектура: три задачи в одном autoregressive-модели
Традиционные голосовые стеки состоят из трех разрозненных систем: одна для транскрипции, вторая для разделения говорящих, третья для определения конца речи. Каждая передача данных между ними добавляет задержку и новые точки отказа. Meta Muse Voice Transcribe, выпущенная Meta Superintelligence Labs, объединяет все три функции в один autoregressive-модель. Это первый в своем роде модель для потоковой аудио-перцепции, которая выполняет потоковую ASR, диаризацию для 20+ говорящих и endpointing за один проход без необходимости постобработки.
Технические детали: адаптивная задержка и RL
Модель работает с аудио в виде 80-миллисекундных чанков с частотой 12.5 Гц. Каждый чанк преобразуется в один "мягкий токен". После каждого чанка модель принимает бинарное решение: либо предсказать токен <|next_audio|> и продолжить слушать, либо выдать текстовый токен. Когда поток заканчивается, вставляется токен
Ключевая инновация — адаптивная задержка, обученная с помощью reinforcement learning (RL). Модель контролирует, сколько аудио-контекста находится за каждым словом, что позволяет варьировать задержку в зависимости от сложности слова. RL-политика оптимизирует компромисс между точностью (WER) и задержкой, помещая модель на Парето-фронт для скорости против точности.
Диаризация и endpointing через токены
Meta не добавляла вторую модель для атрибуции говорящих. Вместо этого были добавлены специальные токены в тот же поток:
- Диаризация: токен <|start_of_turn|> отмечает потенциальное переключение говорящего, а тег
идентифицирует говорящего. Токен поворота срабатывает, как только переключение возможно, а тег говорящего задерживается до конца чанка. - Endpointing: токен <|speech_onset|> отмечает начало речи, а <|speech_endpoint|> — точку, где пользователь закончил говорить. Обе задачи обучаются совместно с потоковой ASR с дополнительными наградами поверх награды ASR.
Производительность и бенчмарки
Модель обучена на 70+ языках, из которых 25 тщательно проверены и рекомендованы при запуске. Поддерживается нативный code-switching (переключение языков внутри предложения и между предложениями). Модель поддерживает ввод аудио длительностью более одного часа и распознавание 20+ говорящих без постобработки.
По данным Artificial Analysis (по состоянию на 1 сентября 2026 года), Muse Voice Transcribe занимает первое место в потоковой speech-to-text и на публичных бенчмарках диаризации:
| Метрика | Muse Voice Transcribe | Cartesia Ink-2 (semantic) | ElevenLabs Scribe v2 | Cartesia Ink-2 (external) |
|---|---|---|---|---|
| Final WER | 3.1% | 3.4% | 3.6% | 4.0% |
| Задержка после конца речи | 0.16s | 0.43s | 0.14s | 0.07s |
| First Partial WER | 3.6% @ 0.13s | - | - | - |
| Diаризация (DER) | 17.5% | 21.1% - 28.6% | 21.1% - 28.6% | 21.1% - 28.6% |
Доступность и цена
Модель доступна только как хостинговый API через Meta Model API под именем muse-voice-transcribe-1.0. Вес модели не опубликован, поэтому самостоятельное развертывание невозможно. Цена составляет $3.00 за 1000 аудио-минут ($0.18 за час), что дешевле Cartesia Ink-2 ($4.00) и менее чем вдвое дешевле ElevenLabs Scribe v2 Realtime и Deepgram Flux ($6.50). Модель уже используется для диктовки в Meta AI для Mac и Muse Code.
Источник: MarkTechPost ↗
