Проблема универсального парсинга
В эпоху Enterprise Document Intelligence единый метод извлечения текста из PDF часто приводит к потере структуры, таблиц и формул. Статья предлагает подход «Nature, plan, execute, synthesize», где первым шагом является определение «природы» документа. Вместо того чтобы гонять каждый файл через один тяжелый парсер, система использует диспетчер (dispatcher), который классифицирует документ и выбирает специализированный инструмент.
Архитектура с умным диспетчером
Ключевая идея — разделение задач. Диспетчер читает метаданные и визуальные признаки PDF, чтобы решить, какой метод парсинга даст наилучший результат. Это позволяет избежать ошибок, когда, например, OCR применяется к текстовому PDF, или простой парсер ломает сложную верстку. Итогом работы этого этапа является единый корпус (corpus) данных, готовый для дальнейшего синтеза.
Сравнение инструментов парсинга
В статье рассматривается пять ключевых технологий, которые могут быть выбраны диспетчером. Их выбор зависит от типа документа (скан, цифровой PDF, сложная верстка):
| Инструмент | Тип | Ключевая особенность |
|---|---|---|
| Fitz (PyMuPDF) | Текстовый/Векторный | Быстрое извлечение текста из цифровых PDF, работа с метаданными |
| Docling | Гибридный | Современный инструмент от IBM, хорошо работает с таблицами и структурой |
| PaddleOCR | OCR (Распознавание) | Высокая точность, особенно для азиатских языков и сложных сканов |
| EasyOCR | OCR (Распознавание) | Простота интеграции, поддержка 80+ языков, подходит для легких задач |
| MinerU | AI-парсер | Специализируется на извлечении структуры из научных статей и отчетов |
| Surya | OCR/Таблицы | Быстрое распознавание текста и таблиц, оптимизировано для скорости |
Зачем это нужно для Agentic RAG?
Полноценные Agentic RAG-системы требуют чистых, структурированных данных. Ошибка на этапе парсинга (например, слияние ячеек таблицы или потеря заголовков) делает невозможным точный ответ от LLM. Предложенный подход с предварительным выбором метода парсинга снижает уровень шума в корпусе данных и повышает надежность финального ответа системы.
Вывод
Переход к Agentic RAG должен начинаться не с выбора модели, а с настройки пайплайна обработки документов. Использование диспетчера, который выбирает между Fitz, Docling, PaddleOCR, EasyOCR, MinerU или Surya, позволяет создать масштабируемую и точную систему Enterprise Document Intelligence.
Источник: Towards Data Science ↗
