Несмотря на то, что тамазит (амазиг) является одним из двух официальных языков Марокко, технологии обработки естественного языка (NLP) для него остаются крайне слабо развитыми. Проблема усугубляется нехваткой размеченных аудиоданных и отсутствием информации о региональных особенностях произношения. Команда исследователей во главе с Мохамедом-Амином Чади из Университета Мохамма V в Рабате представила решение этой проблемы — датасет TutlAit v1.
Масштаб и структура данных
Корпус включает 13 384 аудиофайла общим объемом 75 231 секунда (около 20,9 часов) и весом 3,01 ГБ. Все записи приведены к формату 16 кГц, моно, WAV. Уникальность датасета заключается в наличии явных меток региональных акцентов, что критически важно для создания устойчивых моделей распознавания речи. Основные объемы данных распределены между двумя главными диалектами:
| Региональный акцент | Количество файлов | Длительность (часы) | Доля в корпусе |
|---|---|---|---|
| Атлас (Atlas) | 9 956 | 14,08 | ~67% |
| Сусс (Souss) | 3 378 | 6,75 | ~32% |
| Риф (Rif) | 22 | — | Миноритарный |
| Кабилия (Kabyle) | 28 | — | Миноритарный |
Технология сбора: краудсорсинг и валидация
Сбор данных осуществлялся через специализированное веб-приложение TutlAit, разработанное на стеке React 18 (frontend), Django 5 (backend) и PostgreSQL. Рекрутинг носителей языка проводился через LinkedIn и Instagram. Участники проходили двухэтапную верификацию: указывали свою региональную принадлежность и демографические данные, после чего участвовали в одном из двух рабочих процессов:
- Text-to-Audio: Пользователь видит предложение на современном стандартном арабском языке и записывает его устный перевод на тамазите прямо в браузере.
- Audio-to-Text: Пользователь слушает фрагмент речи на тамазите и вводит его транскрипцию на арабском языке.
Дополнительный сегмент данных был получен из открытых аудиовизуальных медиа, обработан с помощью инструмента ELAN и импортирован через CSV/ZIP-пайплайн. Каждая загрузка проходит автоматическую проверку: хеширование SHA-256 для исключения дубликатов, контроль длительности и финальную валидацию администратором.
Значение для индустрии
Датасет TutlAit v1 закрывает критический пробел в ресурсах для low-resource языков. Наличие параллельных текстов (тамазит-арабский) и меток акцентов открывает возможности для обучения моделей не только для автоматического распознавания речи (ASR), но и для машинного перевода речи в речь, а также для задач идентификации региональной принадлежности говорящего. Исследование опубликовано 27 сентября 2026 года в arXiv (cs.CL).
Источник: arXiv cs.CL ↗
