Проблема: «Тихие» ошибки парсинга
Стандартные OCR-системы часто извлекают текст, но теряют структуру таблиц. Модель может уверенно сгенерировать ответ на основе «мусора», который детерминированные проверки не смогли отловить. Решение — Loop Engineering: конвейер, который начинает с самого дешевого парсера и эскалирует задачу к тяжелым моделям только при наличии сигнала о некачественном извлечении данных.
Архитектура каскадной проверки
Система использует цепочку проверок, где каждая следующая дороже, но надежнее предыдущей. Если дешевый парсер (например, PyMuPDF) не может ответить на вопрос, LLM оценивает собственную «заземленность» (groundedness) и запускает перепарсинг страницы с использованием Azure Layout или Vision-модели.
Кейс А: Плоская таблица (Azure Layout)
В разборе статьи «Attention Is All You Need» возник вопрос: «What is the value of h for the base model in Table of Variations?». Ответ содержался в таблице 3 на странице 9. Обычный парсер выдал плоский текст, потеряв сетку. LLM-генератор на этапе проверки (Check 7) обнаружил несоответствие и инициировал эскалацию к Azure Layout, который корректно восстановил структуру таблицы.
Кейс Б: Оpaque-фигуры (Vision LLM)
Для страниц с диаграммами или сканами, где текст не извлекается, система отправляет изображение напрямую в Vision LLM. Это позволяет извлекать данные из неструктурированных визуальных элементов, которые игнорируются текстовыми парсерами.
Сравнение подходов
| Параметр | Дешевый парсер (PyMuPDF) | Тяжелый парсер (Azure/Vision LLM) |
|---|---|---|
| Скорость | ~5 мс на страницу | ~10 секунд на страницу |
| Стоимость | Практически 0 | До 10 000x дороже |
| Применимость | Чистый текст, простые документы | Таблицы, диаграммы, сканы, сложные лейауты |
| Риск ошибки | Высокий для структурированных данных | Минимальный (при правильной эскалации) |
Вывод
Запуск тяжелых моделей на всех страницах неэффективен. Использование LLM как «последней линии обороны» позволяет экономить ресурсы, обрабатывая сложные случаи выборочно, при этом гарантируя точность ответов в корпоративных RAG-системах.
Источник: Towards Data Science ↗
