Проблема традиционного RAG
Стандартные системы Retrieval-Augmented Generation (RAG) часто страдают от потери контекста при парсинге HTML или извлечении текста из PDF. Таблицы, сложные макеты и рукописные заметки теряют свою структуру при конвертации в плоский текст. Новая методика Pixel-Native RAG предлагает обходной путь: вместо текста документы рендерятся в изображения, что позволяет моделям видеть документ «как есть».
Техническая архитектура
Пайплайн работает по следующему алгоритму:
- Рендеринг: Веб-страницы и PDF преобразуются в изображения с помощью Playwright (Chromium).
- Нарезка (Tiling): Изображения разбиваются на тайлы размером 1024x1024 пикселя с перекрытием 128 пикселей для сохранения контекста границ.
- Векторизация: Используются мультимодальные эмбеддинги от моделей SigLIP (базовая версия patch16-224) или Qwen3-VL.
- Индексация: Векторы хранятся в FAISS с индексом IVF (Inverted File Index) для быстрого поиска.
Гибридный поиск и оценка
Для повышения точности система комбинирует плотный поиск (векторы) и разреженный поиск (BM25 на основе OCR через Tesseract). Результаты объединяются методом Reciprocal Rank Fusion (RRF) с параметром k=60. Оценка качества проводилась на наборе тестовых запросов с метриками Recall@k и Mean Reciprocal Rank (MRR).
| Компонент | Значение/Модель | Роль в системе |
|---|---|---|
| Backend Embedding | SigLIP / Qwen3-VL | Генерация мультимодальных векторов |
| Индексатор | FAISS (IVF) | Быстрый поиск ближайших соседей |
| 1024x1024 px, overlap 128 | Баланс между контекстом и вычислительной нагрузкой | |
| Гибридный вес | Dense: 1.0, Sparse: 1.0 | Равновесие между векторным и текстовым поиском |
| LLM для ответа | Qwen2.5-VL-3B (опционально) | Генерация ответа на основе визуальных доказательств |
Практическая значимость
Подход особенно актуален для документов со сложной версткой, где традиционные парсеры (например, PyPDF2 или BeautifulSoup) дают сбой. Система также включает механизм дедупликации тайлов через average hash (aHash) и фильтрацию пустых блоков, что оптимизирует использование GPU. Архитектура готова к развертыванию через FastAPI и может быть расширена обучением легковесного адаптера с помощью контрастивного обучения.
Источник: MarkTechPost ↗
