Исследования20 августа 2026 г., 07:20 МСК🤖 Auto

Почему глобальные AI-рейтинги игнорируют Индию и Глобальный Юг

Исследование показывает, что существующие AI-лидерборды не учитывают языки и потребности развивающихся стран из-за отсутствия независимого управления, а не из-за нехватки данных.

Баннер новости 6135

Команда исследователей Sourav Banerjee и Saikat Saha опубликовала статью в arXiv, где на примере Индии демонстрирует системный провал глобальных AI-лидербордов. Авторы утверждают, что проблема заключается не в отсутствии качественных данных, а в институциональном дизайне: рейтинги управляются коммерческими интересами Глобального Севера и не имеют механизмов для включения региональных метрик.

Существующие решения игнорируются

Парадокс ситуации в том, что для ключевых языков Глобального Юга уже существуют высококачественные бенчмарки. Однако они не интегрированы в основные рейтинги (такие как Hugging Face Open LLMs или BigCode), так как нет механизма, обязывающего создателей лидербордов их учитывать. Коммерческое давление в Северной Америке и Европе заставляет исправлять ошибки, влияющие на платящих клиентов, но для пользователей хинди, суахили или арабского языка такие сдвиги отсутствуют.

Кейс Индии: 1,4 млрд пользователей и 22 языка

Индия выбрана как кейс-стади из-за масштаба: 1,4 млрд населения и 22 конституционных языка. Исследователи провели консультацию с 58 практикующими AI-специалистами, которые единогласно поддержали идею создания региональных лидербордов с независимым управлением и прозрачным раскрытием конфликтов интересов.

Ниже приведены примеры существующих региональных бенчмарков, которые остаются «за бортом» глобальных рейтингов:

Регион Название бенчмарка Язык/Фокус
Индия IndicSUPERB Индийские языки (ASR, NLP)
Индия MILU Индийские языки (Understanding)
Индия LAHAJA Индийские языки (General)
Африка IrokoBench Африканские языки
Арабский мир AlGhafa Арабский язык

Решение: Институциональные изменения

Авторы приходят к выводу, что решение проблемы не в сборе новых данных, а в создании новых институтов. Необходимы региональные лидерборды, которые с самого начала будут иметь независимую структуру управления. Это позволит зафиксировать реальные показатели моделей для локальных языков и устранить документированные, но игнорируемые пробелы в качестве AI для миллиардов пользователей.

Источник: arXiv cs.AI ↗