Проблема стандартного чанкинга
В большинстве современных RAG-систем (Retrieval-Augmented Generation) документ разбивается на фрагменты (чанки) фиксированного размера, часто постранично или по абзацам. Однако, когда источник данных содержит таблицы, такой подход приводит к потере контекста. Если пользователь задает вопрос о конкретном показателе в таблице, система может вернуть всю таблицу целиком или случайный фрагмент текста, что снижает релевантность ответа LLM.
Решение: Row-Level Chunks
Предлагается новый подход: единицей извлечения (unit of retrieval) становится не страница и не параграф, а отдельная строка таблицы. Каждая строка объединяется с заголовками столбцов, формируя самодостаточный контекстный чанк. Это позволяет системе точно находить ту самую строку, которая отвечает на запрос пользователя, игнорируя нерелевантные данные.
Преимущества для Enterprise Document Intelligence
- Точность: Система возвращает именно те данные, которые нужны, а не «шум» из соседних строк.
- Эффективность: Меньше контекста для LLM — меньше токенов и ниже стоимость запроса.
- Структурированность: Сохраняется связь между значением и его меткой (заголовком столбца).
Практическое применение
Этот метод особенно важен для корпоративных систем анализа документов (Enterprise Document Intelligence), где часто встречаются финансовые отчеты, прайс-листы и технические спецификации. Извлечение на уровне строк превращает неструктурированные или полу-структурированные данные в удобные для поиска семантические блоки.
Источник: Towards Data Science ↗
