Проблема low-resource языков
Мультимодальные большие языковые модели (MLLM) активно продвигаются в области понимания документов, но их надежность в условиях низкоресурсных языков, использующих не-латинские скрипты, остается под вопросом. Кхмерские документы представляют особую сложность: они содержат сложные формы письма, смешанные поля на кхмерском и английском языках, а также денежные значения в двух валютах — камбоджийских риелях (KHR) и долларах США (USD).
Методология и данные
Исследователи Nimol Thuon и Panhapin Theang провели пилотную диагностическую оценку открытых MLLM на изображениях кхмерских документов. В качестве базы данных использовалась коллекция KH-FUNSD, включающая счета-фактуры, чеки, котировки и другие бизнес-формы. Вопросы задавались на английском и кхмерском языках, а ответы сохранялись в оригинальном виде (кхмерский, английский, смешанный или числовой формат).
Результаты сравнения моделей
Авторы сравнили прямое распознавание изображений (direct image-based prompting) с конфигурациями, использующими внешние OCR-системы (Tesseract и PaddleOCR). Лидером среди открытых моделей стал Qwen3-VL-8B, однако его результаты остаются ограниченными, особенно для ответов на кхмерском языке.
| Конфигурация / Модель | Метод обработки | Точность (Accuracy) |
|---|---|---|
| Qwen3-VL-8B | Прямой анализ изображения (Direct) | 51.9% |
| Tesseract | Внешний OCR + MLLM | 61.9% |
| PaddleOCR | Внешний OCR + MLLM | 61.6% |
Ключевые выводы
Результаты показывают, что текущие MLLM способны эффективно обрабатывать визуально четкий английский текст и структурированные числовые данные. Однако надежное родное понимание кхмерских документов остается открытой проблемой. Использование внешних OCR-систем (Tesseract/PaddleOCR) значительно повышает точность, но даже в этом случае ответы на кхмерском скрипте остаются существенно более сложными для модели, чем английские или числовые поля.
Источник: arXiv cs.CL ↗
