Архитектура и ключевые особенности
Новая модель EVIE-Preview-4.5B построена на базе Qwen3.5-4B и использует механизм late-interaction (позднего взаимодействия) в стиле ColBERT. Главная инновация — нативные многовекторные эмбеддинги размером всего 128 измерений на токен. Это позволяет сохранять высокую точность поиска, значительно экономя память и вычислительные ресурсы по сравнению с аналогами, использующими векторы размерностью 2560–4096.
Модель сочетает линейное внимание GatedDeltaNet и гибридное полное внимание, что обеспечивает эффективную обработку как текстовых запросов, так и изображений документов. Она полностью совместима с экосистемой colpali-engine.
Результаты бенчмарков ViDoRe
EVIE-Preview-4.5B демонстрирует лидерские позиции на сложных наборах данных ViDoRe. В частности, она превосходит более крупные модели (8B параметров) в 7 из 8 публичных доменов на benchmark ViDoRe V3. Средний показатель nDCG@5 на комбинации датасетов V1+V2 составил 85.93.
Сравнение с конкурентами
Ниже приведена сравнительная таблица эффективности моделей на бенчмарке ViDoRe V3 (nDCG@10) по 8 публичным доменам. EVIE-Preview-4.5B показывает лучший средний результат среди всех протестированных моделей.
| Модель | Размерность вектора | Средний nDCG@10 (ViDoRe V3) | Лидерство по доменам |
|---|---|---|---|
| EVIE-Preview-4.5B | 128 | 64.40 | 7 из 8 |
| nemotron-colembed-vl-8b-v2 | 4096 | 63.54 | — |
| tomoro-colqwen3-embed-8b | — | 61.60 | — |
| nemotron-colembed-vl-4b-v2 | 2560 | 61.42 | — |
| colqwen3.5-4.5B-v3 | 320 | — | — |
Обучение и данные
Модель обучалась на 0.8 миллиона высококачественных пар «изображение-запрос». В датасет вошли многоязычные документы, технические отчеты, сложные финансовые таблицы, инфографика и данные для визуального QA. Для повышения качества использовалась стратегия Hard Negative Mining: сложные негативные примеры активно отбирались промежуточными ретриверами и верифицировались, а неоднозначные случаи исключались из функции потерь.
Быстрый старт
Модель доступна через Hugging Face под лицензией Apache 2.0. Для инференса требуется установка colpali-engine и использование flash_attention_2. Важно отметить, что для достижения заявленной точности необходимо явно включить двунаправленное внимание (enable_bidirectional_attention()) и сбросить rope_deltas перед обработкой запросов.
Источник: Github ↗
