Решение проблемы мультиязычных диалогов
В рамках MLC-SLM 2026 Challenge команда во главе с Хао У (Hao Wu) представила архитектуру, решающую сложную задачу распознавания речи в условиях двух говорящих на разных языках. Система объединяет модульный фронтенд диаризации с адаптированной моделью Qwen3-ASR-1.7B. Ключевая особенность подхода — разделение аудиопотока на сегменты, атрибутированные конкретному спикеру, с последующей группировкой по языку или региону перед декодированием.
Технический стек и методология
Процесс обработки включает несколько этапов: обнаружение активности голоса (VAD), извлечение эмбеддингов CAMPPlus, спектральную кластеризацию для двух спикеров и сегментацию на основе RTTM. Для адаптации самой модели распознавания использовалась трехэтапная стратегия:
- Supervised Fine-Tuning (SFT): Полное дообучение на официальных тренировочных данных.
- LoRA-адаптация: Использование синтетической речи, сгенерированной через трехпоточный TTS-фреймворк, для расширения данных.
- GRPO Reinforcement Learning: Обучение с подкреплением, где вознаграждение зависит от WER/CER, а штрафы накладываются за галлюцинации, повторы и отклонения длины.
Результаты и метрики
Предложенный подход продемонстрировал значительное снижение ошибки по сравнению с базовой версией модели. На финальном наборе данных (final evaluation set) система достигла среднего показателя tcpMER 17.97. На этапе разработки (development set) результат составил 23.70, что на 6.83 абсолютных пункта лучше, чем у релизной версии Qwen-ASR-1.7B.
| Метрика / Этап | Результат | Примечание |
|---|---|---|
| tcpMER (Dev Set) | 23.70 | Снижение ошибки на 6.83 п.п. относительно базовой модели |
| tcpMER (Eval Set) | 17.97 | Финальный результат на тестовом наборе |
| Базовая модель | Qwen3-ASR-1.7B | Адаптирована через SFT, LoRA и GRPO |
Значение для индустрии
Анализ ablation-результатов показал, что наибольший прирост точности дает именно supervised fine-tuning, тогда как синтетические данные и RL-оптимизация работают на повышение устойчивости модели. Это подтверждает эффективность гибридного подхода к адаптации больших языковых моделей для специфических задач обработки аудио, где критичны мультиязычность и разделение спикеров.
Источник: arXiv cs.CL ↗
