Проблема низкоресурсных языков
Распознавание эмоций по речи (Speech Emotion Recognition, SER) в языках с ограниченным объемом размеченных данных остается сложной задачей. Авторы Ali Shendabadi, Parnia Izadirad и Mostafa Salehi исследуют применение модели Whisper для персидского языка, фокусируясь на двух аспектах: адаптации ASR и снижении размерности представлений (representation dimensionality reduction).
Методология: PCA вместо обучаемых слоев
Предложенный фреймворк извлекает эмбеддинги на уровне фреймов из энкодера Whisper. Вместо добавления новых обучаемых проекционных слоев, авторы применяют метод главных компонент (PCA) для снижения размерности. Это позволяет:
- Устранить необходимость в дополнительных обучаемых параметрах;
- Снизить использование памяти;
- Уменьшить время обучения (training latency).
Сниженные представления агрегируются с помощью механизма внимания (attention-based pooling) и классифицируются легковесной предсказательной головкой.
Эксперименты и результаты
Тестирование проводилось на датасете ShEMO по протоколу независимости от говорящего (speaker-independent). Ключевые выводы:
- PCA-редукция: consistently улучшает показатели распознавания эмоций, одновременно экономя ресурсы.
- Адаптация ASR: дообучение Whisper на задаче распознавания персидской речи дает лишь modest gains (незначительные улучшения) для SER. Это указывает на то, что языковая адаптация слабо переносится на эмоциональные репрезентации в данных условиях.
Значение для индустрии
Работа предоставляет практические инсайты для эффективного использования больших предобученных речевых моделей в низкоресурсных языках. Отказ от сложной донастройки в пользу математической редукции признаков (PCA) оказывается более выгодным компромиссом между производительностью и вычислительной эффективностью.
| Метод | Влияние на SER | Влияние на ресурсы |
|---|---|---|
| PCA редукция | Улучшение точности | Снижение latency и памяти |
| ASR Fine-tuning | Незначительный прирост | Требует дополнительных вычислений |
Источник: arXiv cs.CL ↗
