Релиз модели8 сентября 2026 г., 15:47 МСК🤖 Auto

Tencent EVIE-8B: Новый лидер в поиске по визуальным документам

Tencent открыла код модели EVIE-8B, которая устанавливает новый стандарт точности в задаче визуального поиска документов (VDR), превосходя аналоги на бенчмарке ViDoRe V3.

Баннер новости 7015

Лидерство в визуальном поиске

Лаборатория Tencent представила модель EVIE-8B (Evidence-Vector-Informed Embedding), которая позиционируется как самый точный визуальный документ-ретривер на рынке. Модель базируется на архитектуре Qwen3.5-9B и использует 4096-мерные многовекторные эмбеддинги. Главная инновация заключается в сохранении пространственных нюансов, типографики и структуры таблиц без сжатия информации в один вектор, что критично для сложных документов.

Ключевая метрика успеха — 66.75 nDCG@10 на датасете ViDoRe V3. Это результат выше, чем у ближайших конкурентов, включая специализированные модели на базе Qwen2.5-VL и Nemotron. Полностью открыты веса, код обучения и дистилляции, что позволяет разработчикам внедрять решение в свои пайплайны.

Техническая архитектура: Late-Interaction и Bidirectional Attention

EVIE-8B использует подход late-interaction (позднее взаимодействие). Вместо того чтобы сжимать изображение документа в один вектор, модель генерирует эмбеддинги для каждого токена (patch), сохраняя детальную структуру. Релевантность вычисляется через функцию MaxSim:

max S(Q, D) = ∑ max (q_i · d_j)

Модель применяет полностью двунаправленное внимание (bidirectional full-attention) к мультимодальным последовательностям, что улучшает кросс-модальное взаимодействие между визуальными патчами и текстовыми запросами. Также EVIE-8B выступает учителем (teacher) для более легкой версии EVIE-4.5B, обученной с помощью дистилляции знаний и жестких негативных маржин-супервизий.

Сравнение с конкурентами на ViDoRe

Ниже приведена сравнительная таблица производительности на ключевых бенчмарках ViDoRe. EVIE-8B демонстрирует абсолютное лидерство, особенно на сложной версии V3.

Модель Базовая модель Параметры Вектор ViDoRe V1 (nDCG@5) ViDoRe V2 (nDCG@5) ViDoRe V3 (nDCG@10)
EVIE-8B Qwen3.5-9B 8.41B 4096D 92.18 74.23 66.75
EVIE-4.5B Qwen3.5-4B 4.61B 64–2048D 92.07 73.38 66.02
webAI-ColVec1.1-8b Qwen2.5-VL 8.40B 640D 91.30 65.82 65.32
VultronRetrieverPrime-8B Qwen3.5-9B 8.40B 320D 92.08 68.18 64.26
nemotron-colembed-vl-8b-v2 Nemotron-8B 8.80B 4096D 92.65 65.16 63.54

Валидация на 138 задачах

Модель протестирована на 138 задачах, охватывающих датасеты ViDoRe V1, V2, V3 и JinaVDR. Всего обработано более 60 000 запросов и 170 000 документов. EVIE-8B показывает стабильно высокие результаты во всех семействах метрик: nDCG, Recall, MAP и MRR. Особая сила модели проявляется в доменах Computer Science (81.86 nDCG@10) и Finance (71.23 nDCG@10), где важна точность извлечения числовых данных и таблиц.

Быстрый старт и интеграция

Разработчики могут использовать EVIE-8B через библиотеку Sentence Transformers (версия 6.0.0+) или напрямую через ColPali Engine. Модель поддерживает FlashAttention-2 и двунаправленное внимание. По умолчанию лимит визуальных токенов составляет 16 384, что позволяет обрабатывать многостраничные документы. Код для загрузки и инференса доступен в репозитории Tencent/EVIE на GitHub.

Бенчмарки

БенчмаркEVIE-8BEVIE-4.5BEVIE-Preview-4.5BwebAI-ColVec1.1-8b
ViDoRe V3 (nDCG@10)66.75%66.02%65.36%65.32%
ViDoRe V2 (nDCG@5)74.23%73.38%70.87%65.82%
ViDoRe V1 (nDCG@5)92.18%92.07%91.73%91.3%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Huggingface ↗