Инструменты21 августа 2026 г., 20:17 МСК🤖 Auto

Row-Level Chunks: Как извлекать строки таблиц для RAG

Авторы предлагают заменить стандартное разбиение документов на страницы или абзацы на извлечение отдельных строк таблиц. Это повышает точность RAG-систем при работе с корпоративными данными.

Баннер новости 6257

Проблема стандартного чанкинга

В большинстве современных RAG-систем (Retrieval-Augmented Generation) документ разбивается на фрагменты (чанки) фиксированного размера, часто постранично или по абзацам. Однако, когда источник данных содержит таблицы, такой подход приводит к потере контекста. Если пользователь задает вопрос о конкретном показателе в таблице, система может вернуть всю таблицу целиком или случайный фрагмент текста, что снижает релевантность ответа LLM.

Решение: Row-Level Chunks

Предлагается новый подход: единицей извлечения (unit of retrieval) становится не страница и не параграф, а отдельная строка таблицы. Каждая строка объединяется с заголовками столбцов, формируя самодостаточный контекстный чанк. Это позволяет системе точно находить ту самую строку, которая отвечает на запрос пользователя, игнорируя нерелевантные данные.

Преимущества для Enterprise Document Intelligence

  • Точность: Система возвращает именно те данные, которые нужны, а не «шум» из соседних строк.
  • Эффективность: Меньше контекста для LLM — меньше токенов и ниже стоимость запроса.
  • Структурированность: Сохраняется связь между значением и его меткой (заголовком столбца).

Практическое применение

Этот метод особенно важен для корпоративных систем анализа документов (Enterprise Document Intelligence), где часто встречаются финансовые отчеты, прайс-листы и технические спецификации. Извлечение на уровне строк превращает неструктурированные или полу-структурированные данные в удобные для поиска семантические блоки.

Источник: Towards Data Science ↗