Победа на MLC-SLM Challenge и ключевые характеристики
9 июля 2026 года команда OpenMOSS опубликовала модель MOSS-Transcribe-Diarize 0.9B. Это флагманская open-source архитектура, способная в один проход выполнять распознавание речи (ASR), диаризацию (разделение говорящих) и маркировку временных меток. Модель поддерживает более 50 языков и обрабатывает длинные аудиофайлы (подкасты, встречи, интервью), выдавая структурированный текст с тегами говорящих, например: [0.48][S01]Welcome everyone[1.66].
Решение одержало победу во 2-м конкурсе MLC-SLM Challenge на конференции INTERSPEECH 2026, продемонстрировав превосходство над коммерческими аналогами. Архитектура объединяет текстовый бэкбон Qwen3-0.6B и аудиоэнкодер Whisper-Medium, используя механизм маскирования для слияния признаков.
Сравнение с лидерами рынка: точность против стоимости
Модель 0.9B демонстрирует выдающиеся результаты по метрике cpCER (character error rate с минимальной перестановкой), которая учитывает порядок реплик говорящих. Ниже приведены сравнительные данные на датасетах AISHELL-4 и Podcast:
| Модель | AISHELL-4 (cpCER↓) | AISHELL-4 (Δcp↓) | Podcast (cpCER↓) | Podcast (Δcp↓) |
|---|---|---|---|---|
| GPT-4o | 23.67 | 9.31 | — | — |
| Gemini 2.5 Pro | 53.42 | 10.72 | 41.64 | 14.21 |
| Doubao | 27.86 | 9.68 | 10.54 | 2.61 |
| MOSS-Transcribe-Diarize 0.9B | 15.83 | 0.99 | 7.37 | 1.40 |
| MOSS-Transcribe-Diarize Pro | 14.02 | 0.24 | 6.97 | 2.51 |
Как видно из таблицы, MOSS 0.9B значительно превосходит Doubao и Gemini 2.5 Pro по метрике cpCER на датасете AISHELL-4. Версия Pro, доступная через API, показывает еще более низкие ошибки, приближаясь к GPT-4o, но оставаясь открытой для локального развертывания.
Техническая реализация и производительность
Модель оптимизирована для работы с длинными последовательностями. При тестировании на видеокарте NVIDIA H100 с использованием бэкенда SGLang Omni, модель демонстрирует высокую пропускную способность:
- Короткие аудио (movies): при конкурентности 16 запросов в секунду, пропускная способность достигает 7.08 req/s, а RTF (Real-Time Factor) составляет всего 0.0922 (обработка в 10.8 раз быстрее реального времени).
- Длинные аудио (aishell4_long): при высокой нагрузке RTF остается на уровне 0.0461, что позволяет обрабатывать часы аудио за минуты.
Для развертывания рекомендуется использовать Python 3.12 и библиотеку Transformers 5.x. Модель поддерживает API, совместимый с OpenAI, что упрощает интеграцию в существующие пайплайны обработки данных.
Почему это важно для разработчиков
Раньше для получения качественной диаризации требовалось комбинировать несколько моделей (ASR + Speaker Diarization), что увеличивало задержку и накапливало ошибки. MOSS-Transcribe-Diarize решает эту задачу end-to-end. Наличие версии 0.9B позволяет запускать SOTA-решения на потребительском железе, а версия Pro через API дает доступ к максимальной точности без инфраструктурных затрат. Это критически важно для сервисов субтитров, аналитики звонков и медиаконтента.
Источник: Github ↗
