Инструменты5 августа 2026 г., 15:16 МСК🤖 Auto

Loop Engineering: Как извлечь оглавление PDF из типографики для RAG

Новый подход к подготовке документов для RAG: использование детерминированных правил типографики и ограниченных циклов для восстановления структуры PDF без тяжелых LLM.

Баннер новости 5127

Проблема «плоских» документов в RAG

При внедрении систем RAG (Retrieval-Augmented Generation) в корпоративной среде ключевой проблемой является потеря иерархической структуры документов. Большинство PDF-файлов, особенно отсканированные или экспортированные из Word, теряют семантическое разделение на заголовки и основной текст, превращаясь в «плоский» поток токенов. Это приводит к неточным ответам LLM, так как модель не понимает контекстных границ разделов.

Методология: Loop Engineering

Авторы предлагают метод Loop Engineering, который комбинирует детерминированные правила с валидацией через LLM. Процесс строится на шести сигналах на уровне строк (span-level), основанных исключительно на типографике:

  • Размер шрифта (Font Size): Выявление аномально крупных блоков текста.
  • Жирность (Weight): Обнаружение полужирных начертаний.
  • Выравнивание (Alignment): Анализ центрирования или выравнивания по левому краю.
  • Отступы (Indentation): Измерение белого пространства перед строкой.
  • Межстрочный интервал (Line Spacing): Выявление пустых строк вокруг кандидата.
  • Позиция (Position): Расположение в начале страницы или раздела.

Алгоритм: «Правила предлагают, LLM валидирует»

Вместо того чтобы полагаться исключительно на «черный ящик» нейросети, система сначала использует эвристики для генерации списка кандидатов в заголовки. Затем применяется ограниченный цикл (bounded loop), где LLM выступает в роли валидатора, проверяя только эти кандидаты на соответствие логике документа. Это снижает вычислительные затраты и риск галлюцинаций.

Интеграция с RAG-пайплайном

Результатом работы алгоритма является структура данных toc_df (Table of Contents DataFrame). Эта структура не просто сохраняется, а напрямую внедряется обратно в RAG-пайплайн. Это позволяет чанкеру (разделителю текста) учитывать границы разделов, создавая семантически целостные фрагменты для индексации.

Параметр Традиционный подход Loop Engineering
Источник данных Сырой текст PDF Типографические метаданные + текст
Метод выделения Эвристики или полная LLM-анализация 6 детерминированных сигналов + LLM-валидация
Результат Потеря иерархии Структурированный toc_df
Влияние на RAG Низкая точность контекста Высокая релевантность запросов

Почему это важно

Этот подход демонстрирует тренд на Enterprise Document Intelligence: отказ от слепого доверия LLM в пользу гибридных систем, где детерминированные правила обеспечивают стабильность, а нейросети — гибкость. Для разработчиков RAG это означает возможность создавать более точные и предсказуемые системы работы с корпоративной документацией без необходимости переобучения моделей под каждый новый формат PDF.

Источник: Towards Data Science ↗