Релиз модели7 сентября 2026 г., 00:16 МСК🤖 Auto

NeoMME: Однобашенный энкодер 260M, заменяющий ColPali с экономией в 14 раз

H Company представила NeoMME — семейство мультимодальных энкодеров без отдельного vision-башни и декодера. Модель 260M параметров достигает точности ColQwen2.5 (3.75B) на задаче поиска документов, но работает в 14.4 раза быстрее и потребляет меньше р

Баннер новости 6896

Архитектурный сдвиг: отказ от двойной башни

Большинство современных визуальных ретриверов (например, ColPali) используют генеративные модели, переделанные под задачи кодирования. Это создает избыточность: модель содержит предварительно обученный vision-башню и каузальный декодер, который не генерирует токены, но потребляет ресурсы. H Company предлагает решение NeoMME — однобашенный двунаправленный энкодер, обрабатывающий текст и сырые изображения (патчи 32×32) через одни и те же слои Transformer.

Модель обучена с нуля на случайных весах. Текст кодируется через ALBERT-подобный факторизованный эмбеддинг, а изображения проецируются через 2-слойный MLP. Архитектура использует групповую query-attention, 2D-ротационные позиционные эмбеддинги и контекстное окно до 16,384 токенов, что позволяет обрабатывать два стандартных 4K-изображения за один проход.

Производительность и бенчмарки

NeoMME демонстрирует выдающиеся результаты для своего размера. Модель NeoMME-Retriever-260M достигает показателя 0.523 nDCG@10 на датасете ViDoRe v3. Это значение находится в пределах 0.002 от результата ColQwen2.5-v0.2, которая имеет 3.75 млрд параметров. Таким образом, NeoMME-260M превосходит аналоги размером менее 800M на 26.1 пункта и сопоставима с моделями в 14.4 раза больше по размеру.

Модель Параметры ViDoRe v3 (nDCG@10) Примечание
NeoMME-Retriever-260M 262.9M 0.523 Лучший результат среди моделей < 800M
NeoMME-Retriever-800M 793.7M 0.556 Уступает Vultron Retriever Flash на 0.9
ColQwen2.5-v0.2 3.75B 0.525 Референс для сравнения эффективности
LateOn (BEIR-15) 149M 0.5722 Лучший текстовый ретривер (NeoMME слабее в тексте)

Эффективность индексации и скорость

Основная проблема late-interaction моделей — огромный размер индекса. Для одного документа ViDoRe v3 (2048×2048) сырой индекс занимает ~1.5 МБ. H Company предлагает два метода сжатия:

  • Иерархический пулинг токенов (factor 10): размер индекса снижается до 39.0 КБ (экономия в 39.4 раза) с потерей точности менее 1% (99.16% от базового nDCG@10).
  • Бинаризация документов (factor 8): размер индекса падает до 6.0 КБ (экономия в 255.5 раз), сохраняя 95.19% точности.

На практике модель NeoMME-260M индексирует 51.3 страниц в секунду на одном GPU NVIDIA L40S, что в 1.97 раза быстрее ColModernVBERT. Запрос на CPU-хосте обрабатывается за 78.3 мс.

Обучение и ограничения

Предобучение проводилось методом дискретной маскированной диффузии. Ключевая особенность — принудительное использование визуального контекста: при мультимодальном сегменте уровень маскирования текста варьируется от 0.30 до 1.0, что заставляет модель «читать» страницу, а не полагаться только на текст. При 90% маскировании видимые патчи изображений повышают точность восстановления токенов на 38.4–40.5 пунктов.

Слабым местом остается текстовый поиск: на датасете BEIR-15 NeoMME уступает модели LateOn (0.4881 против 0.5722). Авторы связывают это с меньшим объемом текстовых данных для дообучения (430K примеров против 660M у конкурентов). Все модели выпущены под лицензией Apache 2.0 с поддержкой Hugging Face Transformers.

Источник: MarkTechPost ↗