Релиз модели18 августа 2026 г., 11:46 МСК🤖 Auto

Tencent EVIE-Preview-4.5B: SOTA визуальный поиск с 128D векторами

Tencent представила EVIE-Preview-4.5B — мультимодальную модель на базе Qwen3.5-4B, которая бьет рекорды в визуальном поиске документов, используя сверхкомпактные 128-мерные векторы.

Баннер новости 5982

Архитектура и ключевые особенности

Новая модель EVIE-Preview-4.5B построена на базе Qwen3.5-4B и использует механизм late-interaction (позднего взаимодействия) в стиле ColBERT. Главная инновация — нативные многовекторные эмбеддинги размером всего 128 измерений на токен. Это позволяет сохранять высокую точность поиска, значительно экономя память и вычислительные ресурсы по сравнению с аналогами, использующими векторы размерностью 2560–4096.

Модель сочетает линейное внимание GatedDeltaNet и гибридное полное внимание, что обеспечивает эффективную обработку как текстовых запросов, так и изображений документов. Она полностью совместима с экосистемой colpali-engine.

Результаты бенчмарков ViDoRe

EVIE-Preview-4.5B демонстрирует лидерские позиции на сложных наборах данных ViDoRe. В частности, она превосходит более крупные модели (8B параметров) в 7 из 8 публичных доменов на benchmark ViDoRe V3. Средний показатель nDCG@5 на комбинации датасетов V1+V2 составил 85.93.

Сравнение с конкурентами

Ниже приведена сравнительная таблица эффективности моделей на бенчмарке ViDoRe V3 (nDCG@10) по 8 публичным доменам. EVIE-Preview-4.5B показывает лучший средний результат среди всех протестированных моделей.

Модель Размерность вектора Средний nDCG@10 (ViDoRe V3) Лидерство по доменам
EVIE-Preview-4.5B 128 64.40 7 из 8
nemotron-colembed-vl-8b-v2 4096 63.54
tomoro-colqwen3-embed-8b 61.60
nemotron-colembed-vl-4b-v2 2560 61.42
colqwen3.5-4.5B-v3 320

Обучение и данные

Модель обучалась на 0.8 миллиона высококачественных пар «изображение-запрос». В датасет вошли многоязычные документы, технические отчеты, сложные финансовые таблицы, инфографика и данные для визуального QA. Для повышения качества использовалась стратегия Hard Negative Mining: сложные негативные примеры активно отбирались промежуточными ретриверами и верифицировались, а неоднозначные случаи исключались из функции потерь.

Быстрый старт

Модель доступна через Hugging Face под лицензией Apache 2.0. Для инференса требуется установка colpali-engine и использование flash_attention_2. Важно отметить, что для достижения заявленной точности необходимо явно включить двунаправленное внимание (enable_bidirectional_attention()) и сбросить rope_deltas перед обработкой запросов.

Источник: Github ↗