Архитектурный сдвиг: отказ от двойной башни
Большинство современных визуальных ретриверов (например, ColPali) используют генеративные модели, переделанные под задачи кодирования. Это создает избыточность: модель содержит предварительно обученный vision-башню и каузальный декодер, который не генерирует токены, но потребляет ресурсы. H Company предлагает решение NeoMME — однобашенный двунаправленный энкодер, обрабатывающий текст и сырые изображения (патчи 32×32) через одни и те же слои Transformer.
Модель обучена с нуля на случайных весах. Текст кодируется через ALBERT-подобный факторизованный эмбеддинг, а изображения проецируются через 2-слойный MLP. Архитектура использует групповую query-attention, 2D-ротационные позиционные эмбеддинги и контекстное окно до 16,384 токенов, что позволяет обрабатывать два стандартных 4K-изображения за один проход.
Производительность и бенчмарки
NeoMME демонстрирует выдающиеся результаты для своего размера. Модель NeoMME-Retriever-260M достигает показателя 0.523 nDCG@10 на датасете ViDoRe v3. Это значение находится в пределах 0.002 от результата ColQwen2.5-v0.2, которая имеет 3.75 млрд параметров. Таким образом, NeoMME-260M превосходит аналоги размером менее 800M на 26.1 пункта и сопоставима с моделями в 14.4 раза больше по размеру.
| Модель | Параметры | ViDoRe v3 (nDCG@10) | Примечание |
|---|---|---|---|
| NeoMME-Retriever-260M | 262.9M | 0.523 | Лучший результат среди моделей < 800M |
| NeoMME-Retriever-800M | 793.7M | 0.556 | Уступает Vultron Retriever Flash на 0.9 |
| ColQwen2.5-v0.2 | 3.75B | 0.525 | Референс для сравнения эффективности |
| LateOn (BEIR-15) | 149M | 0.5722 | Лучший текстовый ретривер (NeoMME слабее в тексте) |
Эффективность индексации и скорость
Основная проблема late-interaction моделей — огромный размер индекса. Для одного документа ViDoRe v3 (2048×2048) сырой индекс занимает ~1.5 МБ. H Company предлагает два метода сжатия:
- Иерархический пулинг токенов (factor 10): размер индекса снижается до 39.0 КБ (экономия в 39.4 раза) с потерей точности менее 1% (99.16% от базового nDCG@10).
- Бинаризация документов (factor 8): размер индекса падает до 6.0 КБ (экономия в 255.5 раз), сохраняя 95.19% точности.
На практике модель NeoMME-260M индексирует 51.3 страниц в секунду на одном GPU NVIDIA L40S, что в 1.97 раза быстрее ColModernVBERT. Запрос на CPU-хосте обрабатывается за 78.3 мс.
Обучение и ограничения
Предобучение проводилось методом дискретной маскированной диффузии. Ключевая особенность — принудительное использование визуального контекста: при мультимодальном сегменте уровень маскирования текста варьируется от 0.30 до 1.0, что заставляет модель «читать» страницу, а не полагаться только на текст. При 90% маскировании видимые патчи изображений повышают точность восстановления токенов на 38.4–40.5 пунктов.
Слабым местом остается текстовый поиск: на датасете BEIR-15 NeoMME уступает модели LateOn (0.4881 против 0.5722). Авторы связывают это с меньшим объемом текстовых данных для дообучения (430K примеров против 660M у конкурентов). Все модели выпущены под лицензией Apache 2.0 с поддержкой Hugging Face Transformers.
Источник: MarkTechPost ↗
