Проблема низкоресурсных языков и новый корпус Mizo
Для языка мизо (Mizo), распространенного в индийском штате Мизорам, разработчики создали специализированный корпус для автоматического распознавания речи (ASR). В датасет вошло 17,62 часа оцифрованной речи, которая была тщательно подготовлена для обучения моделей. Это критически важно, так как мизо относится к категории low-resource языков, где стандартные модели часто показывают низкую точность из-за недостатка обучающих данных.
Сравнение Whisper и SraVaani 1.0
В исследовании сравнивались результаты двух подходов: использование предобученной модели Whisper и индийской мультиязычной модели SraVaani 1.0. Ключевой особенностью работы стала не только традиционная метрика WER (Word Error Rate), но и морфологически-осознанная оценка (morphology-aware evaluation), которая учитывает особенности словообразования мизо, делая метрику более релевантной для реального использования.
| Модель | Тип обучения | Традиционный WER | Морфологический WER |
|---|---|---|---|
| Whisper-large-v3 | Fine-tuning | 18,08% | 7,22% |
| SraVaani 1.0 | Zero-shot | 58,27% | — |
| SraVaani 1.0 | Fine-tuning | 29,45% | 17,93% |
Почему это важно
Результаты демонстрируют два ключевых вывода. Во-первых, модель Whisper-large-v3, адаптированная под мизо, достигает выдающихся результатов: традиционная ошибка составляет 18,08%, а с учетом морфологии падает до 7,22%. Это доказывает, что даже для «невидимых» ранее языков можно достичь высокой точности при наличии качественного датасета. Во-вторых, модель SraVaani 1.0, изначально поддерживающая мизо, в режиме zero-shot показала высокий уровень ошибок (58,27%). Однако после тонкой настройки на корпусе мизо ошибка снизилась до 29,45% (традиционный WER) и 17,93% (морфологический WER). Это подчеркивает необходимость дообучения моделей даже для языков, которые уже присутствуют в их мультиязычных наборах данных.
Источник: arXiv cs.CL ↗
