Исследования20 августа 2026 г., 10:18 МСК🤖 Auto

Open-LLM в госсекторе: почему 75% конфигураций провалили тест на извлечение данных

Исследование авторов из Fraunhofer IKS показывает, что даже топовые open-source модели не готовы к ответственной обработке документов в высокорисковых сценариях без тонкой настройки.

Баннер новости 6147

Контекст: Высокорисковые задачи по AI Act

Авторы исследования — Элиас Шуберт и Феликс Бьессманн — провели оценку систем извлечения структурированной информации (SIE) на реальном кейсе: обработке заявок студентов на международные программы обучения. Эта задача классифицируется как высокорисковая (high risk) согласно новому законодательству ЕС AI Act, что требует максимальной надежности и воспроизводимости результатов.

Цель работы — проверить, могут ли открытые решения (OCR + LLM/VLM) заменить проприетарные аналоги в госсекторе, где важна прозрачность, но критична точность.

Методология: 35 конфигураций

Исследователи протестировали end-to-end пайплайны, комбинируя современные OCR-движки с различными Large Language Models (LLM) и Vision-Language Models (VLM). Оценка проводилась в условиях zero-shot (без дообучения на целевом датасете), что имитирует реальную ситуацию внедрения «из коробки».

Ключевые метрики и результаты

Результаты оказались суровыми для энтузиастов open-source. Основная метрика — F1-score (гармоническое среднее точности и полноты). Из 35 протестированных конфигураций:

  • Только 4 модели показали F1 > 0.5.
  • ~75% конфигураций набрали F1 < 0.25, что делает их непригодными для автоматизации.
  • VLM (Vision-Language Models) в целом превзошли связки OCR+LLM, но даже они не достигли уровня надежности, требуемого для автоматического принятия решений.
Категория модели Типичный F1 Score Надежность в zero-shot Комментарий
Топовые VLM Выше 0.5 (лидеры) Низкая/Средняя Лучший класс, но нестабильны
OCR + LLM (связка) Часто < 0.25 Критически низкая Только 1 комбинация сравнялась с VLM
Малые LLM/VLM Ниже 0.25 Неприменимо Не справляются с шумом OCR

Почему масштаб модели не спасает

Один из главных инсайтов работы — нелинейная зависимость от размера модели. Значительно большие модели не гарантируют пропорционально лучших результатов. Ключевым фактором стала качество входных данных, а именно сохранение структуры при распознавании текста OCR.

Если OCR «ломает» структуру документа (таблицы, поля, отступы), даже самая мощная LLM не сможет корректно извлечь данные. Это означает, что инвестиции в дорогие LLM бессмысленны без инвестиций в качественный предобработку и валидацию OCR-выхода.

Вывод для индустрии

Исследование, принятое к публикации на ECML 2026 (Workshop SOMI), ставит крест на идее использования open-source LLM/VLM для критически важных задач в госсекторе «из коробки». Для достижения приемлемого качества требуется глубокая кастомизация пайплайна, а не просто выбор более крупной модели.

Источник: arXiv cs.AI ↗