Исследования21 июля 2026 г., 12:17 МСК🤖 Auto

ColGraphRAG: Как late-interaction улучшает поиск в мультимодальных графах

Исследователь Сеонук Ким представил ColGraphRAG — метод, заменяющий одномерное векторное сравнение изображений на многовекторный анализ ColBERT/ColPali для повышения точности GraphRAG.

Баннер новости 4026

Проблема ранжирования визуальных данных

В системах GraphRAG, опирающихся на структурированные графы знаний, критическим узким местом является этап извлечения доказательств. Традиционные подходы используют одновекторные би-энкодеры (single-vector bi-encoder) для оценки релевантности изображений. Этот метод часто отбрасывает важные детали на уровне патчей и токенов, что приводит к потере структуры, необходимой для тонкой (fine-grained) согласованности текста и визуального контента.

Решение: Late-Interaction MaxSim

В статье ColGraphRAG (arXiv:2607.16208) предложено заменить оператор ранжирования визуальных кандидатов на многовекторное скоринговое взаимодействие late-interaction (MaxSim). Архитектура базируется на линиях моделей ColBERT и ColPali. При этом офлайн-построение графа, извлечение текста/таблиц и нисходящее рассуждение остаются неизменными, что позволяет интегрировать метод в существующие пайплайны.

Результаты на MultimodalQA

Эксперименты показали, что замена визуального ранжирования дает измеримый прирост точности на этапе извлечения (retrieval-stage) и улучшает результаты финального ответа (downstream QA). Эффект наиболее выражен в задачах, где визуальное доказательство является ключевым.

Метрика / Аспект Результат / Наблюдение
Метод ранжирования ColBERT/ColPali lineage (Late-Interaction MaxSim)
Бенчмарк MultimodalQA
Влияние на визуальные данные Значительное улучшение точности извлечения
Влияние на текстовые вопросы Смешанные результаты (mixed trends)
Архитектурные изменения Замена только визуального ранжирования; граф и текст-часть без изменений

Значение для отрасли

Результаты служат механизменным доказательством необходимости включения визуальных доказательств, связанных с графом, через призму детального взаимодействия токенов. Авторы отмечают, что для полной валидации требуются дальнейшие исследования на уровне графа, однако метод уже демонстрирует потенциал для повышения надежности мультимодальных LLM-систем.

Источник: arXiv cs.AI ↗