Суть проблемы
Новое исследование, опубликованное на arXiv, ставит под сомнение реальную способность современных больших языковых моделей (LLM) работать с языками с низким уровнем ресурсности (low-resource languages). Авторы использовали урду как репрезентативный пример и протестировали три топовые модели: GPT-5.1, Qwen-3-Max и DeepSeek-3.1.
Ученые создали корпус Urdu-Stories, состоящий из 93 историй, сгенерированных моделями. Затем была проведена ручная аннотация ошибок по девятибалльной таксономии, охватывающей грамматику, семантику и культурный контекст.
Ключевые находки
Результаты оказались разочаровывающими. Модели демонстрируют не просто «акцент», а фундаментальные пробелы в понимании языка:
- Базовые ошибки: Наличие грубых грамматических и семантических неточностей.
- Отсутствие связности: Тексты теряют логику повествования, содержат неестественные повторы.
- Культурная пустота: Глубокая поверхностность в передаче культурных кодов и контекста.
Почему промпты не помогают
Особую тревогу вызывает то, что использование few-shot prompting (обучения на нескольких примерах) практически не решает проблему. Культурные и контекстуальные ошибки остаются практически неизменными, что указывает на то, что модели не «понимают» язык, а лишь имитируют его структуру.
Сравнение качества генерации
Ниже приведена сводка по выявленным типам ошибок в сгенерированных текстах:
| Категория ошибки | Характер проявления | Влияние на качество |
|---|---|---|
| Грамматика | Нарушение синтаксиса и морфологии урду | Текст выглядит неестественно для носителя |
| Семантика | Нелогичные связи между словами и предложениями | Потеря смысла и когерентности |
| Культурный контекст | Игнорирование локальных реалий и норм | Текст воспринимается как чужеродный |
Вывод
Исследование подчеркивает ограничения текущих LLM как надежного источника генерации контента и извлечения информации для языков с низким уровнем ресурсности. Мультиязычность многих моделей остается лишь маркетинговым заявлением, а не технической реальностью.
Источник: arXiv cs.CL ↗