Контекст: Высокорисковые задачи по AI Act
Авторы исследования — Элиас Шуберт и Феликс Бьессманн — провели оценку систем извлечения структурированной информации (SIE) на реальном кейсе: обработке заявок студентов на международные программы обучения. Эта задача классифицируется как высокорисковая (high risk) согласно новому законодательству ЕС AI Act, что требует максимальной надежности и воспроизводимости результатов.
Цель работы — проверить, могут ли открытые решения (OCR + LLM/VLM) заменить проприетарные аналоги в госсекторе, где важна прозрачность, но критична точность.
Методология: 35 конфигураций
Исследователи протестировали end-to-end пайплайны, комбинируя современные OCR-движки с различными Large Language Models (LLM) и Vision-Language Models (VLM). Оценка проводилась в условиях zero-shot (без дообучения на целевом датасете), что имитирует реальную ситуацию внедрения «из коробки».
Ключевые метрики и результаты
Результаты оказались суровыми для энтузиастов open-source. Основная метрика — F1-score (гармоническое среднее точности и полноты). Из 35 протестированных конфигураций:
- Только 4 модели показали F1 > 0.5.
- ~75% конфигураций набрали F1 < 0.25, что делает их непригодными для автоматизации.
- VLM (Vision-Language Models) в целом превзошли связки OCR+LLM, но даже они не достигли уровня надежности, требуемого для автоматического принятия решений.
| Категория модели | Типичный F1 Score | Надежность в zero-shot | Комментарий |
|---|---|---|---|
| Топовые VLM | Выше 0.5 (лидеры) | Низкая/Средняя | Лучший класс, но нестабильны |
| OCR + LLM (связка) | Часто < 0.25 | Критически низкая | Только 1 комбинация сравнялась с VLM |
| Малые LLM/VLM | Ниже 0.25 | Неприменимо | Не справляются с шумом OCR |
Почему масштаб модели не спасает
Один из главных инсайтов работы — нелинейная зависимость от размера модели. Значительно большие модели не гарантируют пропорционально лучших результатов. Ключевым фактором стала качество входных данных, а именно сохранение структуры при распознавании текста OCR.
Если OCR «ломает» структуру документа (таблицы, поля, отступы), даже самая мощная LLM не сможет корректно извлечь данные. Это означает, что инвестиции в дорогие LLM бессмысленны без инвестиций в качественный предобработку и валидацию OCR-выхода.
Вывод для индустрии
Исследование, принятое к публикации на ECML 2026 (Workshop SOMI), ставит крест на идее использования open-source LLM/VLM для критически важных задач в госсекторе «из коробки». Для достижения приемлемого качества требуется глубокая кастомизация пайплайна, а не просто выбор более крупной модели.
Источник: arXiv cs.AI ↗
