Проблема: разрыв между моделью и данными
Генеративный ИИ отделил модель от конкретной задачи, но enterprise-данные остаются гетерогенными: PDF, сканы, таблицы и диаграммы содержат смешанную информацию. Языковые модели не могут корректно работать с искаженными данными. Ошибки на этапе извлечения (ingestion) необратимы — ни один ретрайвер или реранкер не исправит их позже. Авторы статьи предлагают вынести извлечение в отдельный, измеримый этап жизненного цикла.
Архитектура решения
Система построена на четырех ключевых компонентах, обеспечивающих детерминизм и точность:
- Селективный маршрутизатор OCR: применяет оптическое распознавание только там, где это необходимо, экономя ресурсы.
- Детерминированный чанкер: учитывает структуру документа (родитель-потомок), а не просто режет текст по символам.
- Оценщик извлечения: измеряет точность на уровне символов, слов и структуры таблиц.
- Read-only RAG-оценщик: генерирует вопросы из каждой страницы и проверяет их извлечение без изменения исходных данных.
Метрики и результаты
На тестовом корпусе из 180 документов система продемонстрировала выдающиеся результаты. Лучший экстрактор показал ошибку распознавания символов (CER) всего 0.13%, а сходство таблиц достигло 0.995. Чанкер обеспечил высокий уровень релевантности при поиске:
| Метрика | Значение | Комментарий |
|---|---|---|
| Score Extractor | 97.4 / 100 | Общая оценка качества извлечения |
| Character Error Rate (CER) | 0.13% | Критически низкий уровень ошибок OCR |
| Table Similarity | 0.995 | Почти идеальное сохранение структуры таблиц |
| Hit@1 (Chunker) | 68.6% | Правильный ответ в первом блоке |
| Hit@10 (Chunker) | 92.8% | Правильный ответ в топ-10 блоках |
| MRR (Mean Reciprocal Rank) | 0.77 | Средняя обратная ранговая позиция |
Три принципа проектирования
Авторы формулируют три правила для построения надежных RAG-систем:
- Структура важнее семантики: сначала восстанавливайте геометрию документа, затем анализируйте смысл.
- Никогда не мутируйте то, что измеряете: используйте read-only оценку для честных метрик.
- Бюджетьте лейблы: эффективно распределяйте ресурсы на разметку данных.
Значение для индустрии
Работа позиционирует извлечение контента как «слой восприятия» для enterprise-agentic систем. Это смещает фокус с тонкой настройки LLM на качество подготовки данных, что является узким местом для большинства корпоративных внедрений ИИ сегодня.
Источник: arXiv cs.AI ↗
