Лидерство в визуальном поиске
Лаборатория Tencent представила модель EVIE-8B (Evidence-Vector-Informed Embedding), которая позиционируется как самый точный визуальный документ-ретривер на рынке. Модель базируется на архитектуре Qwen3.5-9B и использует 4096-мерные многовекторные эмбеддинги. Главная инновация заключается в сохранении пространственных нюансов, типографики и структуры таблиц без сжатия информации в один вектор, что критично для сложных документов.
Ключевая метрика успеха — 66.75 nDCG@10 на датасете ViDoRe V3. Это результат выше, чем у ближайших конкурентов, включая специализированные модели на базе Qwen2.5-VL и Nemotron. Полностью открыты веса, код обучения и дистилляции, что позволяет разработчикам внедрять решение в свои пайплайны.
Техническая архитектура: Late-Interaction и Bidirectional Attention
EVIE-8B использует подход late-interaction (позднее взаимодействие). Вместо того чтобы сжимать изображение документа в один вектор, модель генерирует эмбеддинги для каждого токена (patch), сохраняя детальную структуру. Релевантность вычисляется через функцию MaxSim:
max S(Q, D) = ∑ max (q_i · d_j)
Модель применяет полностью двунаправленное внимание (bidirectional full-attention) к мультимодальным последовательностям, что улучшает кросс-модальное взаимодействие между визуальными патчами и текстовыми запросами. Также EVIE-8B выступает учителем (teacher) для более легкой версии EVIE-4.5B, обученной с помощью дистилляции знаний и жестких негативных маржин-супервизий.
Сравнение с конкурентами на ViDoRe
Ниже приведена сравнительная таблица производительности на ключевых бенчмарках ViDoRe. EVIE-8B демонстрирует абсолютное лидерство, особенно на сложной версии V3.
| Модель | Базовая модель | Параметры | Вектор | ViDoRe V1 (nDCG@5) | ViDoRe V2 (nDCG@5) | ViDoRe V3 (nDCG@10) |
|---|---|---|---|---|---|---|
| EVIE-8B | Qwen3.5-9B | 8.41B | 4096D | 92.18 | 74.23 | 66.75 |
| EVIE-4.5B | Qwen3.5-4B | 4.61B | 64–2048D | 92.07 | 73.38 | 66.02 |
| webAI-ColVec1.1-8b | Qwen2.5-VL | 8.40B | 640D | 91.30 | 65.82 | 65.32 |
| VultronRetrieverPrime-8B | Qwen3.5-9B | 8.40B | 320D | 92.08 | 68.18 | 64.26 |
| nemotron-colembed-vl-8b-v2 | Nemotron-8B | 8.80B | 4096D | 92.65 | 65.16 | 63.54 |
Валидация на 138 задачах
Модель протестирована на 138 задачах, охватывающих датасеты ViDoRe V1, V2, V3 и JinaVDR. Всего обработано более 60 000 запросов и 170 000 документов. EVIE-8B показывает стабильно высокие результаты во всех семействах метрик: nDCG, Recall, MAP и MRR. Особая сила модели проявляется в доменах Computer Science (81.86 nDCG@10) и Finance (71.23 nDCG@10), где важна точность извлечения числовых данных и таблиц.
Быстрый старт и интеграция
Разработчики могут использовать EVIE-8B через библиотеку Sentence Transformers (версия 6.0.0+) или напрямую через ColPali Engine. Модель поддерживает FlashAttention-2 и двунаправленное внимание. По умолчанию лимит визуальных токенов составляет 16 384, что позволяет обрабатывать многостраничные документы. Код для загрузки и инференса доступен в репозитории Tencent/EVIE на GitHub.
Бенчмарки
| Бенчмарк | EVIE-8B | EVIE-4.5B | EVIE-Preview-4.5B | webAI-ColVec1.1-8b |
|---|---|---|---|---|
| ViDoRe V3 (nDCG@10) | 66.75% | 66.02% | 65.36% | 65.32% |
| ViDoRe V2 (nDCG@5) | 74.23% | 73.38% | 70.87% | 65.82% |
| ViDoRe V1 (nDCG@5) | 92.18% | 92.07% | 91.73% | 91.3% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
