Проблема «плоских» документов в RAG
При внедрении систем RAG (Retrieval-Augmented Generation) в корпоративной среде ключевой проблемой является потеря иерархической структуры документов. Большинство PDF-файлов, особенно отсканированные или экспортированные из Word, теряют семантическое разделение на заголовки и основной текст, превращаясь в «плоский» поток токенов. Это приводит к неточным ответам LLM, так как модель не понимает контекстных границ разделов.
Методология: Loop Engineering
Авторы предлагают метод Loop Engineering, который комбинирует детерминированные правила с валидацией через LLM. Процесс строится на шести сигналах на уровне строк (span-level), основанных исключительно на типографике:
- Размер шрифта (Font Size): Выявление аномально крупных блоков текста.
- Жирность (Weight): Обнаружение полужирных начертаний.
- Выравнивание (Alignment): Анализ центрирования или выравнивания по левому краю.
- Отступы (Indentation): Измерение белого пространства перед строкой.
- Межстрочный интервал (Line Spacing): Выявление пустых строк вокруг кандидата.
- Позиция (Position): Расположение в начале страницы или раздела.
Алгоритм: «Правила предлагают, LLM валидирует»
Вместо того чтобы полагаться исключительно на «черный ящик» нейросети, система сначала использует эвристики для генерации списка кандидатов в заголовки. Затем применяется ограниченный цикл (bounded loop), где LLM выступает в роли валидатора, проверяя только эти кандидаты на соответствие логике документа. Это снижает вычислительные затраты и риск галлюцинаций.
Интеграция с RAG-пайплайном
Результатом работы алгоритма является структура данных toc_df (Table of Contents DataFrame). Эта структура не просто сохраняется, а напрямую внедряется обратно в RAG-пайплайн. Это позволяет чанкеру (разделителю текста) учитывать границы разделов, создавая семантически целостные фрагменты для индексации.
| Параметр | Традиционный подход | Loop Engineering |
|---|---|---|
| Источник данных | Сырой текст PDF | Типографические метаданные + текст |
| Метод выделения | Эвристики или полная LLM-анализация | 6 детерминированных сигналов + LLM-валидация |
| Результат | Потеря иерархии | Структурированный toc_df |
| Влияние на RAG | Низкая точность контекста | Высокая релевантность запросов |
Почему это важно
Этот подход демонстрирует тренд на Enterprise Document Intelligence: отказ от слепого доверия LLM в пользу гибридных систем, где детерминированные правила обеспечивают стабильность, а нейросети — гибкость. Для разработчиков RAG это означает возможность создавать более точные и предсказуемые системы работы с корпоративной документацией без необходимости переобучения моделей под каждый новый формат PDF.
Источник: Towards Data Science ↗
