Релиз модели6 октября 2026 г., 10:18 МСК🤖 Auto

Falcon-Emirati-7B: ИИ, говорящий на эмиратском диалекте

TII представила модель Falcon-Emirati-7B, специализированную на эмиратском диалекте арабского языка. Модель достигла 84.83% на бенчмарке Alyah, превзойдя более крупные аналоги.

Баннер новости 9016

Закрытие разрыва между MSA и реальным общением

Команда TII (Technology Innovation Institute) представила Falcon-Emirati-7B — модель, созданную для понимания и генерации эмиратского диалекта (Gulf Arabic) с учетом культурного контекста. В отличие от Современного стандартного арабского (MSA), который используется в СМИ и учебниках, эмиратский диалект обладает уникальной лексикой, ритмом и опирается на культурные коды, такие как поэзия набати и пословицы. Буквальный перевод MSA часто искажает смысл в разговорной речи, что и призвана исправить новая архитектура.

Архитектура: гибрид Mamba и Transformer

Модель построена на базе Falcon-H1-Arabic, использующей гибридную архитектуру. В каждом блоке параллельно работают State Space Models (Mamba) для линейной эффективности на длинных последовательностях и Transformer-аттеншн для точности при работе с дальними зависимостями. Выбор 7B параметров стал компромиссом: 3B недостаточно для глубины понимания культуры, а 34B слишком затратны для специализированной диалектной модели. Контекстное окно поддерживает до 128K–256K токенов.

Три источника данных: от краулинга до синтетики

Адаптация диалекта осложнена нехваткой письменных данных. Команда использовала три этапа подготовки данных:

  • Аутентичный веб-краулинг: Сбор контента с эмиратских форумов и сайтов, написанного носителями на диалекте, а не переведенного с MSA.
  • Культурный контекст на MSA: Статьи о традициях, истории и социальных нормах ОАЭ для обучения модели «пониманию» темы, а не только формы.
  • Синтетические данные с глоссариями: Генерация недостающих тем с жесткими ограничениями по словарю и грамматике, чтобы избежать «искусственного» звучания.

Результаты на бенчмарке Alyah

Оценка проводилась с помощью Alyah (الياه) — специализированного бенчмарка из 1 173 вопросов, охватывающих этикет, идиомы, поэзию и повседневное общение. Модель прошла как автоматическую проверку, так и ручную оценку носителями языка. Falcon-Emirati-7B показала результат 84.83%, превзойдя другие арабские и мультиязычные модели, включая значительно более крупные.

Метрика / Характеристика Значение / Описание
Результат на Alyah 84.83%
Количество параметров 7B
Базовая архитектура Falcon-H1 (Mamba + Transformer)
Размер контекста до 128K–256K токенов
Объем бенчмарка Alyah 1 173 выборки (multiple-choice)

Почему это важно

Запуск Falcon-Emirati-7B демонстрирует, что специализация на локальных диалектах возможна без перетренировки гигантских моделей. Это открывает путь к созданию более доступных и культурно-чувствительных AI-ассистентов для арабоязычного региона, где лингвистическое разнообразие часто игнорируется в пользу универсальных MSA-решений.

Источник: Hugging Face blog ↗