Релиз модели14 июля 2026 г., 13:45 МСК🤖 Auto

MOSS-Transcribe-Diarize 0.9B: SOTA-модель для транскрибации и диаризации

Команда OpenMOSS открыла код модели MOSS-Transcribe-Diarize 0.9B, занявшей первое место на MLC-SLM Challenge. Это end-to-end решение для многоголосой транскрипции, превосходящее GPT-4o и Gemini по точности.

Баннер новости 3534

Победа на MLC-SLM Challenge и ключевые характеристики

9 июля 2026 года команда OpenMOSS опубликовала модель MOSS-Transcribe-Diarize 0.9B. Это флагманская open-source архитектура, способная в один проход выполнять распознавание речи (ASR), диаризацию (разделение говорящих) и маркировку временных меток. Модель поддерживает более 50 языков и обрабатывает длинные аудиофайлы (подкасты, встречи, интервью), выдавая структурированный текст с тегами говорящих, например: [0.48][S01]Welcome everyone[1.66].

Решение одержало победу во 2-м конкурсе MLC-SLM Challenge на конференции INTERSPEECH 2026, продемонстрировав превосходство над коммерческими аналогами. Архитектура объединяет текстовый бэкбон Qwen3-0.6B и аудиоэнкодер Whisper-Medium, используя механизм маскирования для слияния признаков.

Сравнение с лидерами рынка: точность против стоимости

Модель 0.9B демонстрирует выдающиеся результаты по метрике cpCER (character error rate с минимальной перестановкой), которая учитывает порядок реплик говорящих. Ниже приведены сравнительные данные на датасетах AISHELL-4 и Podcast:

Модель AISHELL-4 (cpCER↓) AISHELL-4 (Δcp↓) Podcast (cpCER↓) Podcast (Δcp↓)
GPT-4o 23.67 9.31
Gemini 2.5 Pro 53.42 10.72 41.64 14.21
Doubao 27.86 9.68 10.54 2.61
MOSS-Transcribe-Diarize 0.9B 15.83 0.99 7.37 1.40
MOSS-Transcribe-Diarize Pro 14.02 0.24 6.97 2.51

Как видно из таблицы, MOSS 0.9B значительно превосходит Doubao и Gemini 2.5 Pro по метрике cpCER на датасете AISHELL-4. Версия Pro, доступная через API, показывает еще более низкие ошибки, приближаясь к GPT-4o, но оставаясь открытой для локального развертывания.

Техническая реализация и производительность

Модель оптимизирована для работы с длинными последовательностями. При тестировании на видеокарте NVIDIA H100 с использованием бэкенда SGLang Omni, модель демонстрирует высокую пропускную способность:

  • Короткие аудио (movies): при конкурентности 16 запросов в секунду, пропускная способность достигает 7.08 req/s, а RTF (Real-Time Factor) составляет всего 0.0922 (обработка в 10.8 раз быстрее реального времени).
  • Длинные аудио (aishell4_long): при высокой нагрузке RTF остается на уровне 0.0461, что позволяет обрабатывать часы аудио за минуты.

Для развертывания рекомендуется использовать Python 3.12 и библиотеку Transformers 5.x. Модель поддерживает API, совместимый с OpenAI, что упрощает интеграцию в существующие пайплайны обработки данных.

Почему это важно для разработчиков

Раньше для получения качественной диаризации требовалось комбинировать несколько моделей (ASR + Speaker Diarization), что увеличивало задержку и накапливало ошибки. MOSS-Transcribe-Diarize решает эту задачу end-to-end. Наличие версии 0.9B позволяет запускать SOTA-решения на потребительском железе, а версия Pro через API дает доступ к максимальной точности без инфраструктурных затрат. Это критически важно для сервисов субтитров, аналитики звонков и медиаконтента.

Источник: Github ↗