Релиз модели3 сентября 2026 г., 16:17 МСК🤖 Auto

NeoMME: Мультиязычный энкодер без VLM-архитектуры

Hcompany представила NeoMME — семейство из двух мультимодальных энкодеров (260M и 800M параметров), которые обрабатывают текст и изображения в едином bidirectional Transformer, исключая необходимость в отдельных визуальных башнях.

Баннер новости 6684

Архитектурный сдвиг: один Transformer для всего

В отличие от современных генеративных визуальных языковых моделей (VLM), которые используют отдельную предварительно обученную визуальную башню (например, SigLIP2) и причинный декодер, NeoMME обучается с нуля как единый bidirectional Transformer. Модель обрабатывает текстовые токены и сырые патчи изображений (32×32 пикселя) через один и тот же вычислительный путь. Это устраняет накладные расходы на проекцию между модальностями и позволяет динамически адаптировать количество токенов к разрешению изображения, сохраняя соотношение сторон.

Технические характеристики и метрики

NeoMME использует 16 384 токенов контекста, групповую квантованную внимание (GQA) и скользящее окно внимания. Для обучения применялся оптимизатор NorMuon, что позволило эффективно использовать 524 млрд токенов (включая 290 млрд текстовых). Модель поддерживает мультиязычность через BPE-токенизатор на 131k токенов.

Метрика / Характеристика NeoMME-Retriever-260M NeoMME-Retriever-800M Аналоги / Контекст
Параметры 260M 800M ColQwen2.5 (~3.8B)
nDCG@10 (ViDoRe v3) 0.523 0.556 ColQwen2.5: 0.525
Пропускная способность (L40S, 2048x2048) ~51 стр/сек Информация недостаточна В 2 раза быстрее ColModernVBERT
Хранение индекса (после квантования) 6 kB на страницу 6 kB на страницу Сокращение в 255 раз (vs 1.5 MB)

Двойная голова для поиска: Dense и Late-Interaction

Модель NeoMME-Retriever обучена с двумя головами: dense (усреднение скрытых состояний для быстрого ANN-поиска) и late-interaction (проекция каждого токена в 128-мерное пространство для точного сопоставления, как в ColBERT). Оба вектора генерируются за один прямой проход. Использование асимметричного квантования позволяет сократить размер индекса late-interaction с ~1.5 МБ до 6 КБ на страницу, сохранив более 95% точности nDCG@10.

Значение для индустрии

NeoMME демонстрирует, что для задач визуального документного поиска (Visual RAG) не обязательно использовать тяжелые VLM-архитектуры. Модель находится на Парето-фронте ViDoRe v3, предлагая высокую скорость и компактность. Все чекпоинты выпущены под лицензией Apache 2.0 и доступны в Hugging Face Transformers.

Источник: Hugging Face blog ↗