Исследования12 сентября 2026 г., 05:18 МСК🤖 Auto

Мультиязычие лишь на бумаге: LLM провалили тест на урду

Исследование выявило критические языковые и культурные ошибки в текстах GPT-5.1, Qwen-3-Max и DeepSeek-3.1, сгенерированных на урду.

Суть проблемы

Новое исследование, опубликованное на arXiv, ставит под сомнение реальную способность современных больших языковых моделей (LLM) работать с языками с низким уровнем ресурсности (low-resource languages). Авторы использовали урду как репрезентативный пример и протестировали три топовые модели: GPT-5.1, Qwen-3-Max и DeepSeek-3.1.

Ученые создали корпус Urdu-Stories, состоящий из 93 историй, сгенерированных моделями. Затем была проведена ручная аннотация ошибок по девятибалльной таксономии, охватывающей грамматику, семантику и культурный контекст.

Ключевые находки

Результаты оказались разочаровывающими. Модели демонстрируют не просто «акцент», а фундаментальные пробелы в понимании языка:

  • Базовые ошибки: Наличие грубых грамматических и семантических неточностей.
  • Отсутствие связности: Тексты теряют логику повествования, содержат неестественные повторы.
  • Культурная пустота: Глубокая поверхностность в передаче культурных кодов и контекста.

Почему промпты не помогают

Особую тревогу вызывает то, что использование few-shot prompting (обучения на нескольких примерах) практически не решает проблему. Культурные и контекстуальные ошибки остаются практически неизменными, что указывает на то, что модели не «понимают» язык, а лишь имитируют его структуру.

Сравнение качества генерации

Ниже приведена сводка по выявленным типам ошибок в сгенерированных текстах:

Категория ошибки Характер проявления Влияние на качество
Грамматика Нарушение синтаксиса и морфологии урду Текст выглядит неестественно для носителя
Семантика Нелогичные связи между словами и предложениями Потеря смысла и когерентности
Культурный контекст Игнорирование локальных реалий и норм Текст воспринимается как чужеродный

Вывод

Исследование подчеркивает ограничения текущих LLM как надежного источника генерации контента и извлечения информации для языков с низким уровнем ресурсности. Мультиязычность многих моделей остается лишь маркетинговым заявлением, а не технической реальностью.

Источник: arXiv cs.CL ↗