Исследования2 октября 2026 г., 02:19 МСК🤖 Auto

TutlAit v1: первый датасет тамазита с метками акцентов и 20 часами аудио

Исследователи представили TutlAit v1 — крупнейший открытый корпус речи на марокканском тамазите (амазиг), собранный через краудсорсинг с точной разметкой региональных диалектов и арабскими транскриптами.

Баннер новости 8737

Несмотря на то, что тамазит (амазиг) является одним из двух официальных языков Марокко, технологии обработки естественного языка (NLP) для него остаются крайне слабо развитыми. Проблема усугубляется нехваткой размеченных аудиоданных и отсутствием информации о региональных особенностях произношения. Команда исследователей во главе с Мохамедом-Амином Чади из Университета Мохамма V в Рабате представила решение этой проблемы — датасет TutlAit v1.

Масштаб и структура данных

Корпус включает 13 384 аудиофайла общим объемом 75 231 секунда (около 20,9 часов) и весом 3,01 ГБ. Все записи приведены к формату 16 кГц, моно, WAV. Уникальность датасета заключается в наличии явных меток региональных акцентов, что критически важно для создания устойчивых моделей распознавания речи. Основные объемы данных распределены между двумя главными диалектами:

Региональный акцент Количество файлов Длительность (часы) Доля в корпусе
Атлас (Atlas) 9 956 14,08 ~67%
Сусс (Souss) 3 378 6,75 ~32%
Риф (Rif) 22 — Миноритарный
Кабилия (Kabyle) 28 — Миноритарный

Технология сбора: краудсорсинг и валидация

Сбор данных осуществлялся через специализированное веб-приложение TutlAit, разработанное на стеке React 18 (frontend), Django 5 (backend) и PostgreSQL. Рекрутинг носителей языка проводился через LinkedIn и Instagram. Участники проходили двухэтапную верификацию: указывали свою региональную принадлежность и демографические данные, после чего участвовали в одном из двух рабочих процессов:

  • Text-to-Audio: Пользователь видит предложение на современном стандартном арабском языке и записывает его устный перевод на тамазите прямо в браузере.
  • Audio-to-Text: Пользователь слушает фрагмент речи на тамазите и вводит его транскрипцию на арабском языке.

Дополнительный сегмент данных был получен из открытых аудиовизуальных медиа, обработан с помощью инструмента ELAN и импортирован через CSV/ZIP-пайплайн. Каждая загрузка проходит автоматическую проверку: хеширование SHA-256 для исключения дубликатов, контроль длительности и финальную валидацию администратором.

Значение для индустрии

Датасет TutlAit v1 закрывает критический пробел в ресурсах для low-resource языков. Наличие параллельных текстов (тамазит-арабский) и меток акцентов открывает возможности для обучения моделей не только для автоматического распознавания речи (ASR), но и для машинного перевода речи в речь, а также для задач идентификации региональной принадлежности говорящего. Исследование опубликовано 27 сентября 2026 года в arXiv (cs.CL).

Источник: arXiv cs.CL ↗