Исследования7 октября 2026 г., 13:18 МСК🤖 Auto

Smart Content Ingestion: как извлечь 97.4% точности из PDF для RAG

Исследователи представили систему извлечения данных, которая решает проблему «мусора на входе» в RAG-системах, достигая 97.4% точности и 68.6% Hit@1 на корпусе из 180 документов.

Баннер новости 9104

Проблема: разрыв между моделью и данными

Генеративный ИИ отделил модель от конкретной задачи, но enterprise-данные остаются гетерогенными: PDF, сканы, таблицы и диаграммы содержат смешанную информацию. Языковые модели не могут корректно работать с искаженными данными. Ошибки на этапе извлечения (ingestion) необратимы — ни один ретрайвер или реранкер не исправит их позже. Авторы статьи предлагают вынести извлечение в отдельный, измеримый этап жизненного цикла.

Архитектура решения

Система построена на четырех ключевых компонентах, обеспечивающих детерминизм и точность:

  • Селективный маршрутизатор OCR: применяет оптическое распознавание только там, где это необходимо, экономя ресурсы.
  • Детерминированный чанкер: учитывает структуру документа (родитель-потомок), а не просто режет текст по символам.
  • Оценщик извлечения: измеряет точность на уровне символов, слов и структуры таблиц.
  • Read-only RAG-оценщик: генерирует вопросы из каждой страницы и проверяет их извлечение без изменения исходных данных.

Метрики и результаты

На тестовом корпусе из 180 документов система продемонстрировала выдающиеся результаты. Лучший экстрактор показал ошибку распознавания символов (CER) всего 0.13%, а сходство таблиц достигло 0.995. Чанкер обеспечил высокий уровень релевантности при поиске:

Метрика Значение Комментарий
Score Extractor 97.4 / 100 Общая оценка качества извлечения
Character Error Rate (CER) 0.13% Критически низкий уровень ошибок OCR
Table Similarity 0.995 Почти идеальное сохранение структуры таблиц
Hit@1 (Chunker) 68.6% Правильный ответ в первом блоке
Hit@10 (Chunker) 92.8% Правильный ответ в топ-10 блоках
MRR (Mean Reciprocal Rank) 0.77 Средняя обратная ранговая позиция

Три принципа проектирования

Авторы формулируют три правила для построения надежных RAG-систем:

  1. Структура важнее семантики: сначала восстанавливайте геометрию документа, затем анализируйте смысл.
  2. Никогда не мутируйте то, что измеряете: используйте read-only оценку для честных метрик.
  3. Бюджетьте лейблы: эффективно распределяйте ресурсы на разметку данных.

Значение для индустрии

Работа позиционирует извлечение контента как «слой восприятия» для enterprise-agentic систем. Это смещает фокус с тонкой настройки LLM на качество подготовки данных, что является узким местом для большинства корпоративных внедрений ИИ сегодня.

Источник: arXiv cs.AI ↗