Проблема оценки арабского языка
Оценка качества больших языковых моделей (LLM) на арабском языке сталкивается с серьезной проблемой: для достоверной проверки требуется не только знание языка, но и глубокое понимание культуры. Традиционные метрики не работают, так как они не учитывают социолингвистические нюансы. Исследователи из команды во главе с Саджадом Абдоли разработали новую систему кросс-оценки, сфокусированную на двух недопредставленных диалектах: египетском и иракском арабском.
Методология: 103 пары «запрос-оценка»
В основе исследования лежит набор из 103 валидированных пар промптов и рубрик, созданных носителями языка (SME). Из них 70 относятся к египетскому диалекту и 33 — к иракскому. Задачи были разделены на две категории: 53 культурных и 50 лингвистических. Оценка проводилась с использованием штрафных рубрик, которые четко разделяют положительные требования к контенту и специфические ошибки в ответе.
Результаты: GPT-5.4 как эталон
Три передовые модели LLM выступали в роли тестируемых объектов, а пять других моделей служили автоматическими судьями. Всего было проведено 1 307 оценок. Ключевым выводом стало то, что GPT-5.4 показал наилучшие результаты как автоматический судья, минимизируя ошибки оценки.
| Модель-судья | MAD (Среднее абсолютное отклонение) | Смещение оценки (Signed Error) | Комментарий |
|---|---|---|---|
| GPT-5.4 | 10.21 pp | -1.12% | Самый надежный судья, минимальное смещение |
| Другие 4 модели | — | +2.01% до +6.56% | Систематически завышают оценки (снисходительность) |
Культура против Лингвистики
Исследование выявило, что оценивать культурные задачи сложнее, чем лингвистические. Разница в средней абсолютной ошибке (MAD) между этими типами задач составила от 1.83 до 4.78 процентных пунктов. Главная причина неудач автоматических судей — имплицитное культурное рассуждение. Моделям трудно симулировать суждение носителя языка, когда требуется опираться на контекст, а не просто проверять лексическое соответствие.
Египетский vs. Иракский: разрыв в знаниях
Модели значительно лучше справлялись с промптами на египетском диалекте, чем на иракском. Однако исследователи предупреждают: нельзя однозначно списывать это на недостаток знаний модели. Разница в строгости оценки между экспертами-носителями египетского и иракского диалектов также играет роль. Поэтому выводы делаются с осторожностью, не предполагая идентичной строгости всех человеческих градеров.
Почему это важно?
Для разработчиков LLM это сигнал: поверхностные метрики точности не работают для нишевых языков. Внедрение моделей в высокорисковые сферы (юридические, медицинские консультации на арабском) требует не просто лингвистической точности, а культурной валидации. GPT-5.4 показал, что даже передовые модели могут служить надежным «вторым мнением» для экспертов, но только при условии правильной настройки рубрик оценки.
Источник: arXiv cs.CL ↗
