Инструменты5 августа 2026 г., 03:16 МСК🤖 Auto

Pixel-Native RAG: Как визуализация документов улучшает поиск без OCR

Исследователи представили пайплайн PixelRAG, который индексирует PDF и веб-страницы как изображения, используя SigLIP и FAISS для точного поиска, минуя традиционное извлечение текста.

Баннер новости 5089

Проблема традиционного RAG

Стандартные системы Retrieval-Augmented Generation (RAG) часто страдают от потери контекста при парсинге HTML или извлечении текста из PDF. Таблицы, сложные макеты и рукописные заметки теряют свою структуру при конвертации в плоский текст. Новая методика Pixel-Native RAG предлагает обходной путь: вместо текста документы рендерятся в изображения, что позволяет моделям видеть документ «как есть».

Техническая архитектура

Пайплайн работает по следующему алгоритму:

  • Рендеринг: Веб-страницы и PDF преобразуются в изображения с помощью Playwright (Chromium).
  • Нарезка (Tiling): Изображения разбиваются на тайлы размером 1024x1024 пикселя с перекрытием 128 пикселей для сохранения контекста границ.
  • Векторизация: Используются мультимодальные эмбеддинги от моделей SigLIP (базовая версия patch16-224) или Qwen3-VL.
  • Индексация: Векторы хранятся в FAISS с индексом IVF (Inverted File Index) для быстрого поиска.

Гибридный поиск и оценка

Для повышения точности система комбинирует плотный поиск (векторы) и разреженный поиск (BM25 на основе OCR через Tesseract). Результаты объединяются методом Reciprocal Rank Fusion (RRF) с параметром k=60. Оценка качества проводилась на наборе тестовых запросов с метриками Recall@k и Mean Reciprocal Rank (MRR).

d>Параметры тайлов
Компонент Значение/Модель Роль в системе
Backend Embedding SigLIP / Qwen3-VL Генерация мультимодальных векторов
Индексатор FAISS (IVF) Быстрый поиск ближайших соседей
1024x1024 px, overlap 128 Баланс между контекстом и вычислительной нагрузкой
Гибридный вес Dense: 1.0, Sparse: 1.0 Равновесие между векторным и текстовым поиском
LLM для ответа Qwen2.5-VL-3B (опционально) Генерация ответа на основе визуальных доказательств

Практическая значимость

Подход особенно актуален для документов со сложной версткой, где традиционные парсеры (например, PyPDF2 или BeautifulSoup) дают сбой. Система также включает механизм дедупликации тайлов через average hash (aHash) и фильтрацию пустых блоков, что оптимизирует использование GPU. Архитектура готова к развертыванию через FastAPI и может быть расширена обучением легковесного адаптера с помощью контрастивного обучения.

Источник: MarkTechPost ↗