Архитектура и ключевые характеристики
North Micro Vision — это самая компактная зрительно-языковая модель (VLM) от Cohere Labs на данный момент. Архитектура состоит из трех компонентов: кастомного визуального энкодера на 400M параметров, проектора и языковой модели North Micro LLM на 2B параметров. Языковая часть построена на архитектуре Command A+, которая чередует три слоя внимания с скользящим окном (использующие Rotary Positional Embeddings) с одним глобальным слоем внимания без позиционных эмбеддингов. Это позволяет модели эффективно обрабатывать длинные контексты и сохранять пространственную структуру изображений.
Нативное разрешение и работа с документами
Главное отличие модели — поддержка изображений нативного разрешения без принудительного сжатия до квадрата. Визуальный энкодер, базирующийся на SigLIP 2 SO400M, прошел специализированное обучение для сохранения деталей документов, таблиц и графиков. Модель способна обрабатывать страницу формата A4 при 200 dpi, сохраняя исходное соотношение сторон. Это критически важно для задач OCR, анализа форм и работы с мелким текстом, где стандартные VLM часто теряют информацию из-за ресайзинга.
Процесс обучения в 4 этапа
Обучение модели прошло через четыре стадии, включая увеличение разрешения и инструкционное тюнингирование:
- Stage 1 (10M примеров): Обучение энкодера и проектора на разрешении 384x384 пикселей с использованием данных для OCR и плотных описаний.
- Stage 2.1 (13M примеров): Увеличение разрешения до 1024x1024, совместное обучение всех компонентов.
- Stage 2.2 (10M примеров): Достижение нативного разрешения до 1654x2339 пикселей (эквивалент A4 при 200 dpi).
- Stage 3 (50M примеров): Инструкционное тюнингирование на разнообразных данных, включая графики, таблицы и визуальное заземление (grounding).
- Stage 4 (500k примеров): Применение упрощенного варианта Mixed Preference Optimization (MPO) для улучшения безопасности, форматирования и качества ответов.
Распределение данных для инструкционного тюнинга
На этапе Stage 3 модель обучалась на смеси данных, где доминировали задачи, требующие точного понимания визуального контента:
| Категория данных | Доля в датасете |
|---|---|
| Нативный OCR | 17.8% |
| Графики и таблицы | 17.8% |
| Grounding и подсчет объектов | 13.3% |
| OCR QA | 13.3% |
| Общий VQA | 11.2% |
| Описание и знания | 8.9% |
| Только текст | 8.9% |
| Математика | 4.4% |
| Наука | 4.4% |
Практическое применение и доступность
Модель выпущена под лицензией Apache 2.0, что делает ее открытой для коммерческого использования. Благодаря компактному размеру (2.4B параметров), North Micro Vision предназначена для развертывания не только на серверах, но и на ноутбуках, мобильных устройствах и edge-железе при использовании соответствующих стеков инференса и квантования. Поддержка vLLM находится в разработке. Весы модели доступны на Hugging Face по адресу CohereLabs/North-Micro-Vision-Instruct.
Источник: Huggingface ↗
