Релиз модели3 октября 2026 г., 21:18 МСК🤖 Auto

Microsoft MAI-Transcribe-2: #1 в реальном времени, WER 2.5% за 0.13с

Microsoft AI выпустила модель MAI-Transcribe-2-Streaming, занявшую первое место в бенчмарке Artificial Analysis по точности и задержке. Модель транскрибирует 60 языков с задержкой финального результата всего 0.13 секунды.

Баннер новости 8866

Рекордная скорость и точность

1 октября 2026 года Microsoft AI представила MAI-Transcribe-2-Streaming — первую потоковую модель распознавания речи (STT) от компании. Согласно данным Artificial Analysis, она заняла 1-е место из 38 моделей по индексу AA-WER Streaming. Ключевая метрика: финальная транскрипция достигается с ошибкой 2.5% WER всего через 0.13 секунды после окончания речи. Примечательно, что первые частичные гипотезы (partials) появляются уже через 100 мс и имеют ту же точность 2.5% WER, что позволяет агентам ИИ начинать обработку текста еще до того, как пользователь закончит фразу.

Сравнение с конкурентами

Модель превосходит ближайших соперников по балансу точности и задержки. Хотя Cartesia Ink-2 возвращает результат быстрее (0.07с), его точность значительно ниже (4.0% WER). Ниже приведена сравнительная таблица с ключевыми конкурентами:

Характеристика MAI-Transcribe-2-Streaming Grok Voice Transcribe 2.0 Muse Voice Transcribe Gemini 3.5 Transcribe Live
Разработчик Microsoft AI xAI Meta Superintelligence Labs Google
Дата выхода 1 окт. 2026 18 сен. 2026 1 сен. 2026 26 авг. 2026
AA-WER Streaming (final) 2.5% 2.7% 3.1% 4.0%
Время до финала 0.13s 0.49s 0.16s Не сообщено
Цена / час (вводная) $0.54 $0.20 $0.18 ~$0.54
Языки 60 (авто-детект) Десятки 70+ (25 верифицированы) 85+

Интеграция и экосистема

Разработчики могут интегрировать модель двумя путями: через Realtime API (совместимо с WebSocket OpenAI) или через Azure Speech SDK, который берет на себя управление соединениями и ретраями. Модель доступна в MAI Playground, через Vercel и Azure Voice Live. Поддержка LiveKit находится в разработке.

Microsoft позиционирует MAI-Transcribe-2-Streaming как часть полного голосового цикла. В паре с моделью синтеза речи MAI-Voice-2.1-Flash (150 мс задержки, $15 за 1 млн символов) она позволяет создавать голосовых агентов с минимальным лагом. Полноценная версия MAI-Voice-2.1 поддерживает 23 языка и стоит $22 за 1 млн символов.

Стоимость и доступность

Вводная цена на потоковую транскрипцию составляет $0.54 за час аудио (нормализовано до $9.00 за 1000 минут), что действует до конца 2026 года. Это дороже решений от xAI ($0.20/ч) и Meta ($0.18/ч), но сопоставимо с оценочной стоимостью Google. Пакетная версия MAI-Transcribe-2 стоит значительно дешевле — $0.10 за час. На данный момент модель доступна в публичной превью-версии без SLA и без открытых весов.

Источник: MarkTechPost ↗