Исследования22 августа 2026 г., 01:18 МСК🤖 Auto

Mizo ASR: Whisper vs SraVaani 1.0 на редком языке с учетом морфологии

Исследователи создали корпус для распознавания речи на мизо (низкоресурсный язык) и показали, что тонкая настройка Whisper дает WER 18%, а учет морфологии снижает ошибку до 7,22%.

Баннер новости 6277

Проблема низкоресурсных языков и новый корпус Mizo

Для языка мизо (Mizo), распространенного в индийском штате Мизорам, разработчики создали специализированный корпус для автоматического распознавания речи (ASR). В датасет вошло 17,62 часа оцифрованной речи, которая была тщательно подготовлена для обучения моделей. Это критически важно, так как мизо относится к категории low-resource языков, где стандартные модели часто показывают низкую точность из-за недостатка обучающих данных.

Сравнение Whisper и SraVaani 1.0

В исследовании сравнивались результаты двух подходов: использование предобученной модели Whisper и индийской мультиязычной модели SraVaani 1.0. Ключевой особенностью работы стала не только традиционная метрика WER (Word Error Rate), но и морфологически-осознанная оценка (morphology-aware evaluation), которая учитывает особенности словообразования мизо, делая метрику более релевантной для реального использования.

Модель Тип обучения Традиционный WER Морфологический WER
Whisper-large-v3 Fine-tuning 18,08% 7,22%
SraVaani 1.0 Zero-shot 58,27%
SraVaani 1.0 Fine-tuning 29,45% 17,93%

Почему это важно

Результаты демонстрируют два ключевых вывода. Во-первых, модель Whisper-large-v3, адаптированная под мизо, достигает выдающихся результатов: традиционная ошибка составляет 18,08%, а с учетом морфологии падает до 7,22%. Это доказывает, что даже для «невидимых» ранее языков можно достичь высокой точности при наличии качественного датасета. Во-вторых, модель SraVaani 1.0, изначально поддерживающая мизо, в режиме zero-shot показала высокий уровень ошибок (58,27%). Однако после тонкой настройки на корпусе мизо ошибка снизилась до 29,45% (традиционный WER) и 17,93% (морфологический WER). Это подчеркивает необходимость дообучения моделей даже для языков, которые уже присутствуют в их мультиязычных наборах данных.

Источник: arXiv cs.CL ↗