Архитектурный сдвиг: один Transformer для всего
В отличие от современных генеративных визуальных языковых моделей (VLM), которые используют отдельную предварительно обученную визуальную башню (например, SigLIP2) и причинный декодер, NeoMME обучается с нуля как единый bidirectional Transformer. Модель обрабатывает текстовые токены и сырые патчи изображений (32×32 пикселя) через один и тот же вычислительный путь. Это устраняет накладные расходы на проекцию между модальностями и позволяет динамически адаптировать количество токенов к разрешению изображения, сохраняя соотношение сторон.
Технические характеристики и метрики
NeoMME использует 16 384 токенов контекста, групповую квантованную внимание (GQA) и скользящее окно внимания. Для обучения применялся оптимизатор NorMuon, что позволило эффективно использовать 524 млрд токенов (включая 290 млрд текстовых). Модель поддерживает мультиязычность через BPE-токенизатор на 131k токенов.
| Метрика / Характеристика | NeoMME-Retriever-260M | NeoMME-Retriever-800M | Аналоги / Контекст |
|---|---|---|---|
| Параметры | 260M | 800M | ColQwen2.5 (~3.8B) |
| nDCG@10 (ViDoRe v3) | 0.523 | 0.556 | ColQwen2.5: 0.525 |
| Пропускная способность (L40S, 2048x2048) | ~51 стр/сек | Информация недостаточна | В 2 раза быстрее ColModernVBERT |
| Хранение индекса (после квантования) | 6 kB на страницу | 6 kB на страницу | Сокращение в 255 раз (vs 1.5 MB) |
Двойная голова для поиска: Dense и Late-Interaction
Модель NeoMME-Retriever обучена с двумя головами: dense (усреднение скрытых состояний для быстрого ANN-поиска) и late-interaction (проекция каждого токена в 128-мерное пространство для точного сопоставления, как в ColBERT). Оба вектора генерируются за один прямой проход. Использование асимметричного квантования позволяет сократить размер индекса late-interaction с ~1.5 МБ до 6 КБ на страницу, сохранив более 95% точности nDCG@10.
Значение для индустрии
NeoMME демонстрирует, что для задач визуального документного поиска (Visual RAG) не обязательно использовать тяжелые VLM-архитектуры. Модель находится на Парето-фронте ViDoRe v3, предлагая высокую скорость и компактность. Все чекпоинты выпущены под лицензией Apache 2.0 и доступны в Hugging Face Transformers.
Источник: Hugging Face blog ↗
