Главная/Блог/Аналитика/NeoMME: Архитектура без Vision Tower…
Аналитика9 мин чтения · 7 сентября 2026 г.

NeoMME: Архитектура без Vision Tower для эффективного поиска

H Company представила NeoMME — семейство мультимодальных энкодеров, объединяющих текст и изображения в одном трансформере. Разбор архитектуры, результатов и практического применения.

NeoMME: Архитектура без Vision Tower для эффективного поиска

В современном ландшафте искусственного интеллекта, особенно в области информационного поиска и работы с документами, мы наблюдаем тенденцию, которую можно охарактеризовать как «рецидив» архитектурных компромиссов. Большинство визуальных документальных ретриверов, развернутых в продакшене сегодня, по сути, являются переделанными решениями прошлого. Модели, такие как ColPali и их последователи, берут генеративные зрительно-языковые модели (VLM) и адаптируют их для задач кодирования. Однако этот подход несет в себе существенный архитектурный груз: модель сохраняет отдельно предобученный «башню зрения» (vision tower) и причинный декодер (causal decoder), который в задаче поиска никогда не генерирует токены. Это приводит к избыточным затратам параметров и вычислительных ресурсов на задачу, которая по своей природе требует лишь качественных представлений (representations), а не генерации текста.

Компания H Company предлагает радикально иное решение с выпуском семейства моделей NeoMME (Neo Multimodal Encoder). Это семейство включает модели объемом 260 миллионов и 800 миллионов параметров, которые полностью отказываются от обеих упомянутых выше компонент. Вместо сложной архитектуры с несколькими башнями, NeoMME использует единый двунаправленный трансформер, который обрабатывает токены многоязычного текста и сырые патчи изображений (32×32 пикселя RGB) через одни и те же слои. Обучение начинается с случайной инициализации, что позволяет модели выучить оптимальное взаимодействие модальностей с нуля. Модель для тонкой настройки поиска, NeoMME-Retriever, демонстрирует впечатляющий результат nDCG@10 на уровне 0.523 на датасете ViDoRe v3, имея всего 260 миллионов параметров.

Но является ли эта архитектура действительно пригодной для развертывания в реальных условиях? Ответ — да. Каждый чекпоинт выпущен под лицензией Apache 2.0, что обеспечивает полную открытость. Более того, модели поддерживаются «день-в-день» в библиотеке Hugging Face Transformers. Производительность впечатляет: модель NeoMME-260M способна индексировать 51,3 страницы в секунду на одном графическом процессоре NVIDIA L40S и кодировать запрос за 78,3 миллисекунды на сервере, использующем только центральный процессор (CPU). Это открывает новые горизонты для развертывания мультимодального поиска даже в условиях ограниченных ресурсов.

01Одна башня, две модальности: Архитектурная революция

Сердцем NeoMME является уникальный подход к обработке входных данных. В отличие от традиционных VLM, где текст и изображения обрабатываются разными путями до их объединения, NeoMME использует единую архитектуру трансформера для обеих модальностей. Давайте разберем, как именно это работает на уровне технических деталей.

Текстовое представление: Факторизованная эмбеддинг-структура

Текст поступает в модель через механизм, вдохновленный архитектурой ALBERT. Используется так называемая «факторизованная эмбеддинг-структура» (factorized embedding). Сначала токены проходят через lookup-таблицу размерности 256, а затем проецируются в ширину модели. Это позволяет эффективно хранить и обрабатывать текстовые данные, снижая память, затрачиваемую на эмбеддинги, без потери качества представления.

Визуальное представление: Прямая проекция патчей

Изображения обрабатываются еще более прямолинейно. Картинка разбивается на неперекрывающиеся патчи размером 32×32 пикселя. Эти патчи затем проецируются в пространство модели с помощью многослойного перцептрона (MLP) из двух слоев, который обучается с нуля. Здесь важно отметить отсутствие модуля слияния патчей (patch-merging) и отказ от использования тяжелой башни SigLIP2. Это радикально упрощает визуальный компонент, убирая вычислительные накладные расходы, характерные для больших зрительных моделей.

Архитектура трансформера

Обе модели (260M и 800M) поддерживают контекстное окно длиной до 16 384 токенов. Этого объема достаточно для обработки двух стандартных изображений в разрешении 4K UHD (3840×2160 пикселей) после их разбиения на патчи. Архитектура слоев оптимизирована для эффективности:

  • Внимание: Большинство слоев используют симметричное скользящее окно внимания (sliding-window attention), что ограничивает область внимания локальным контекстом и снижает сложность вычислений. Однако каждые шестой слой и финальный слой используют глобальное внимание, позволяя модели улавливать долгосрочные зависимости.
  • Механизмы оптимизации: Стек использует групповое запросное внимание (grouped-query attention), нормализацию запросов и ключей (query-key normalization), затворное внимание (gated attention) и 2D-ротационные позиционные эмбеддинги (2D rotary position embeddings).
  • Активация: В качестве функции активации в MLP используется квадратичный ReLU (squared-ReLU), что может улучшать сходимость и стабильность обучения.
NeoMME: Архитектура без Vision Tower для эффективного поиска

Точное количество параметров составляет 262 937 906 для младшей модели и 793 715 032 для старшей. Токенизатор представляет собой BPE (Byte-Pair Encoding) без ограничений пробелов, с словарем размером 131 072 токенов, также обученным с нуля. Это обеспечивает гибкость в обработке текста на разных языках.

💡
Технический нюанс. Использование 2D-ротационных позиционных эмбеддингов критически важно для мультимодальных моделей, работающих с изображениями. В отличие от 1D-позиционных эмбеддингов, используемых в чистом тексте, 2D-вариант сохраняет пространственную структуру изображения, позволяя трансформеру «понимать», где именно в кадре находится объект, даже после разбиения на патчи.

02Обучение как маскированная диффузия

Одним из самых инновационных аспектов NeoMME является метод предобучения. Модель обучается как «диффузионный денуйзер» (denoiser) с дискретной маскировкой. Это означает, что модель пытается восстановить скрытые части входных данных, видя только часть информации.

Маскирование текста и изображений

Процесс предобучения включает в себя случайное маскирование токенов текста и патчей изображений. Для сегментов, содержащих только текст, уровень маскирования (corruption rate) выбирается равномерно из диапазона от 0 до 1. Для мультимодальных сегментов (где есть и текст, и изображения) уровень маскирования выбирается из диапазона от 0,30 до 1. Этот выбор не случаен: он намеренно удаляет «языковой ярлык» (language-only shortcut). Если бы модель могла полагаться только на текст, она бы игнорировала изображение. Повышая уровень маскирования текста в мультимодальных сегментах, авторы заставляют модель обязательно «читать страницу», используя визуальный контекст для восстановления пропущенных слов.

Результаты аблиционных исследований

Кросс-модальный зонд (ablation probe) подтверждает эффективность этого подхода. При уровне маскирования 90% видимые патчи страницы повышают точность восстановления маскированных токенов на 38,4 пункта для модели 260M и на 40,5 пункта для модели 800M. Это доказывает, что визуальная информация действительно помогает модели лучше понимать текстовый контент, особенно в сложных документах, где текст может быть неполным или зашумленным.

Обучение проводилось на огромных объемах данных: каждый запуск обрабатывал около 524 миллиардов упакованных входных токенов, из которых примерно 290 миллиардов были только текстовыми. Вычисления выполнялись на 16 и 32 ускорителях NVIDIA H100 соответственно, что подчеркивает масштаб усилий, вложенных в создание этой архитектуры.

⚠️ Важно для разработчиков.
Локальный запуск. Благодаря открытой лицензии Apache 2.0 и поддержке в Hugging Face Transformers, вы можете загрузить NeoMME и запустить её локально на вашем оборудовании. Для тестирования производительности на CPU достаточно стандартной библиотеки Python, что делает технологию доступной для исследователей и разработчиков без доступа к мощным GPU.

03Результаты поиска: Сравнение с лидерами

Главный вопрос к любой новой модели поиска: насколько она хороша в реальных задачах? NeoMME-Retriever добавляет две совместно обученные головы (heads) к общему остову (backbone):

  1. Плотная голова (Dense head): Использует усредненное пулирование (mean-pooled) с шириной Матрешки (Matryoshka), что позволяет извлекать векторы разной размерности для разных задач.
  2. Позднее взаимодействие (Late-interaction head): Проецирует каждый токен и каждый патч изображения в пространство размерности 128. Это позволяет модели учитывать тонкие совпадения между запросом и документом.
NeoMME: Архитектура без Vision Tower для эффективного поиска

Один прямой проход (forward pass) возвращает оба типа представлений, что дает гибкость при развертывании.

Датасет ViDoRe v3

На сложном датасете ViDoRe v3, предназначенном для оценки поиска по визуальным документам, результаты впечатляют:

  • NeoMME-260M: nDCG@10 = 0.523. Этот результат находится в пределах 0.002 от модели ColQwen2.5-v0.2, которая имеет 3,75 миллиарда параметров. То есть, NeoMME в 14,4 раза меньше, но показывает сопоставимое качество. Кроме того, она превосходит все другие оцененные модели с объемом менее 300 миллионов параметров на 26,1 пункта.
  • NeoMME-800M: nDCG@10 = 0.556. Эта модель уступает всего на 0,9 пункта модели Vultron Retriever Flash схожего размера, что ставит её в один ряд с передовыми решениями.

На более ранних версиях датасета (ViDoRe v1 и v2) модели также показывают высокие результаты: 0.860/0.522 и 0.874/0.559 nDCG@5 соответственно.

Текстовый поиск: BEIR-15

В задачах чисто текстового поиска (датасет BEIR-15) результаты немного слабее. Позднее взаимодействие достигает 0.4881 (для 260M) и 0.5126 (для 800M), в то время как модель LateOn (149M параметров) показывает 0.5722. Авторы объясняют это различие масштабом обучения: NeoMME увидела примерно 430 000 примеров текстовых запросов, в то время как mLateOn обучалась на 660 миллионах контрастивных примеров. Это указывает на то, что для улучшения текстовых результатов потребуется больше текстовых данных для дообучения.

📌 Факт.
Эффективность параметров. Соотношение качества и размера у NeoMME-260M является одним из лучших на рынке. Сравнение с ColQwen2.5 (3.75B) демонстрирует, как отказ от избыточных компонентов (vision tower и decoder) позволяет достичь SOTA-результатов при минимальных затратах ресурсов.

04Хранение и пропускная способность: Оптимизация индексов

Одним из главных недостатков методов позднего взаимодействия (late-interaction) является дороговизна индексов. Для страницы размером 2048×2048 пикселей генерируется 4 162 вектора, что составляет около 1,5 МБ на документ в формате float32. Для больших коллекций это может стать проблемой. Однако NeoMME предлагает два эффективных метода сжатия.

Иерархическая пулинг токенов

Метод иерархического пулинга (hierarchical token pooling) позволяет значительно сократить размер индекса:

NeoMME: Архитектура без Vision Tower для эффективного поиска
  • Коэффициент 10: При использовании int8 для запросов и документов размер индекса снижается до 39,0 КБ на страницу. Это сокращение в 39,4 раза, при этом сохраняется 99,16% от базового nDCG@10.
  • Коэффициент 8: При использовании int8 для запросов и бинарных документов (binary documents) размер индекса падает до 6,0 КБ. Это сокращение в 255,5 раз, с сохранением 95,19% качества. Это делает NeoMME невероятно эффективной для развертывания в условиях жестких ограничений по памяти.

Скорость индексирования

Скорость кодирования также является сильной стороной. При входе размером 2048×2048 на одном GPU NVIDIA L40S, NeoMME-260M кодирует 51,3 страниц в секунду. Для сравнения, ColModernVBERT обрабатывает 26,0 страниц в секунду. Таким образом, NeoMME работает в 1,97 раза быстрее, что критически важно для систем реального времени.

05Что это значит на практике

Выпуск NeoMME знаменует собой сдвиг парадигмы в области мультимодального информационного поиска. Отказ от традиционной архитектуры «Vision Tower + Causal Decoder» в пользу единого двунаправленного энкодера демонстрирует, что для задач поиска не нужна избыточная сложность генеративных моделей. Это приводит к:

  1. Значительному снижению затрат на инфраструктуру: Возможность работы на CPU и быстрое кодирование на L40S делают развертывание доступным для малого и среднего бизнеса.
  2. Эффективности хранения: Методы квантования и пулинга позволяют хранить огромные базы документов в памяти, используя всего несколько килобайт на страницу.
  3. Открытости и доступности: Лицензия Apache 2.0 и интеграция с Hugging Face позволяют любому исследователю или разработчику начать работу с моделью немедленно.

Однако, как и у любой новой технологии, есть области для улучшения. Слабые результаты в чисто текстовом поиске (BEIR-15) указывают на необходимость увеличения объема текстовых данных для дообучения. Также остается открытым вопрос переноса знаний с естественных изображений (natural-image transfer), который, вероятно, потребует дополнительной адаптации модели.

В целом, NeoMME предлагает мощный, легкий и эффективный инструмент для работы с визуальными документами. Для компаний, ищущих способ интегрировать поиск по PDF, сканам и изображениям в свои продукты без огромных затрат на GPU, NeoMME становится одним из самых привлекательных решений на рынке в 2026 году. Это не просто еще одна модель, это шаг к более рациональному и эффективному использованию ресурсов в эпоху больших данных.

Источник: MarkTechPost ↗