Исследования1 июля 2026 г., 16:16 МСК🤖 Auto

Indi-RomCoM: LLM провалили тест на хингли и другие языки

Новый бенчмарк Indi-RomCoM показал, что современные LLM плохо понимают смешанный индийско-английский текст. Точность падает с ростом плотности английского в тексте.

Баннер новости 2739

Проблема «Хингли» и других смешанных языков

Исследователи из Индии представили Indi-RomCoM — первый специализированный бенчмарк для оценки способности больших языковых моделей (LLM) работать с Romanized Code Mixing (RCM). Это форма общения, где билингвы смешивают местные языки (хинди, бенгали, телугу, тамильский и др.) с английским, используя латиницу. Пример: "Aaj mood kharab hai, please fix it".

Несмотря на то, что модели отлично справляются с чистым английским или текстами на родных скриптах, их реакция на RCM остается «черным ящиком». Indi-RomCoM заполняет этот пробел, предоставляя структурированную среду для тестирования.

Методология: 7 задач, 4 языка, 3 уровня смешения

Бенчмарк охватывает четыре широко распространенных индийских языка и включает семь типов инструкций (от классификации до генерации). Ключевая особенность — три контролируемых уровня интенсивности смешения языков (code-mixing density), что позволяет измерить, как именно падает качество при увеличении доли английского слова.

Результаты: Генерация лучше детекции

Авторы протестировали набор моделей, включая проприетарные, open-weight и специализированные индийские модели. Результаты показали системное отставание LLM на RCM-задачах. Важное наблюдение: задачи генерации (reasoning) страдают меньше, чем задачи детекции (например, определение токсичности). Это связано с тем, что при генерации ответа модель создает контекст, который помогает ей лучше понять запрос, тогда как при простой классификации она остается «вслепую».

Сравнение производительности

Ниже приведена общая картина деградации производительности в зависимости от типа задачи и уровня смешения языков:

Тип задачи Влияние плотности смешения Причина устойчивости/падения
Reasoning (Генерация/Объяснение) Умеренное снижение Сгенерированный ответ создает дополнительный контекст, помогая модели «распутать» запрос.
Detection (Классификация/Токсичность) Сильное снижение Модели не могут опираться на генерацию для уточнения смысла, что приводит к ошибкам классификации.

Значение для индустрии

В Индии и других регионах с высокой долей билингвов RCM является доминирующей формой цифрового общения. Игнорирование этого формата делает AI-системы неинклюзивными для миллионов пользователей. Indi-RomCoM предоставляет сообществу инструмент для разработки более robust-моделей, способных работать в реальных условиях «смешанного» интернета.

Источник: arXiv cs.CL ↗