Исследования2 сентября 2026 г., 02:24 МСК🤖 Auto

MLLMs провалили тест на кхмерских документах: точность до 62%

Исследование показало, что даже топовые мультимодальные модели (Qwen3-VL) с трудом понимают документы на кхмерском языке, уступая классическим OCR-системам.

Баннер новости 6544

Проблема low-resource языков

Мультимодальные большие языковые модели (MLLM) активно продвигаются в области понимания документов, но их надежность в условиях низкоресурсных языков, использующих не-латинские скрипты, остается под вопросом. Кхмерские документы представляют особую сложность: они содержат сложные формы письма, смешанные поля на кхмерском и английском языках, а также денежные значения в двух валютах — камбоджийских риелях (KHR) и долларах США (USD).

Методология и данные

Исследователи Nimol Thuon и Panhapin Theang провели пилотную диагностическую оценку открытых MLLM на изображениях кхмерских документов. В качестве базы данных использовалась коллекция KH-FUNSD, включающая счета-фактуры, чеки, котировки и другие бизнес-формы. Вопросы задавались на английском и кхмерском языках, а ответы сохранялись в оригинальном виде (кхмерский, английский, смешанный или числовой формат).

Результаты сравнения моделей

Авторы сравнили прямое распознавание изображений (direct image-based prompting) с конфигурациями, использующими внешние OCR-системы (Tesseract и PaddleOCR). Лидером среди открытых моделей стал Qwen3-VL-8B, однако его результаты остаются ограниченными, особенно для ответов на кхмерском языке.

Конфигурация / Модель Метод обработки Точность (Accuracy)
Qwen3-VL-8B Прямой анализ изображения (Direct) 51.9%
Tesseract Внешний OCR + MLLM 61.9%
PaddleOCR Внешний OCR + MLLM 61.6%

Ключевые выводы

Результаты показывают, что текущие MLLM способны эффективно обрабатывать визуально четкий английский текст и структурированные числовые данные. Однако надежное родное понимание кхмерских документов остается открытой проблемой. Использование внешних OCR-систем (Tesseract/PaddleOCR) значительно повышает точность, но даже в этом случае ответы на кхмерском скрипте остаются существенно более сложными для модели, чем английские или числовые поля.

Источник: arXiv cs.CL ↗