Релиз модели17 августа 2026 г., 13:46 МСК🤖 Auto

Cohere Labs выпустила North Micro Vision: 2.4B VLM с нативным разрешением

Cohere Labs представила компактную мультимодальную модель North Micro Vision (2.4B параметров) с поддержкой изображений нативного разрешения. Модель работает под лицензией Apache 2.0 и оптимизирована для локального развертывания на edge-устройствах.

Баннер новости 5913

Архитектура и ключевые характеристики

North Micro Vision — это самая компактная зрительно-языковая модель (VLM) от Cohere Labs на данный момент. Архитектура состоит из трех компонентов: кастомного визуального энкодера на 400M параметров, проектора и языковой модели North Micro LLM на 2B параметров. Языковая часть построена на архитектуре Command A+, которая чередует три слоя внимания с скользящим окном (использующие Rotary Positional Embeddings) с одним глобальным слоем внимания без позиционных эмбеддингов. Это позволяет модели эффективно обрабатывать длинные контексты и сохранять пространственную структуру изображений.

Нативное разрешение и работа с документами

Главное отличие модели — поддержка изображений нативного разрешения без принудительного сжатия до квадрата. Визуальный энкодер, базирующийся на SigLIP 2 SO400M, прошел специализированное обучение для сохранения деталей документов, таблиц и графиков. Модель способна обрабатывать страницу формата A4 при 200 dpi, сохраняя исходное соотношение сторон. Это критически важно для задач OCR, анализа форм и работы с мелким текстом, где стандартные VLM часто теряют информацию из-за ресайзинга.

Процесс обучения в 4 этапа

Обучение модели прошло через четыре стадии, включая увеличение разрешения и инструкционное тюнингирование:

  • Stage 1 (10M примеров): Обучение энкодера и проектора на разрешении 384x384 пикселей с использованием данных для OCR и плотных описаний.
  • Stage 2.1 (13M примеров): Увеличение разрешения до 1024x1024, совместное обучение всех компонентов.
  • Stage 2.2 (10M примеров): Достижение нативного разрешения до 1654x2339 пикселей (эквивалент A4 при 200 dpi).
  • Stage 3 (50M примеров): Инструкционное тюнингирование на разнообразных данных, включая графики, таблицы и визуальное заземление (grounding).
  • Stage 4 (500k примеров): Применение упрощенного варианта Mixed Preference Optimization (MPO) для улучшения безопасности, форматирования и качества ответов.

Распределение данных для инструкционного тюнинга

На этапе Stage 3 модель обучалась на смеси данных, где доминировали задачи, требующие точного понимания визуального контента:

Категория данных Доля в датасете
Нативный OCR 17.8%
Графики и таблицы 17.8%
Grounding и подсчет объектов 13.3%
OCR QA 13.3%
Общий VQA 11.2%
Описание и знания 8.9%
Только текст 8.9%
Математика 4.4%
Наука 4.4%

Практическое применение и доступность

Модель выпущена под лицензией Apache 2.0, что делает ее открытой для коммерческого использования. Благодаря компактному размеру (2.4B параметров), North Micro Vision предназначена для развертывания не только на серверах, но и на ноутбуках, мобильных устройствах и edge-железе при использовании соответствующих стеков инференса и квантования. Поддержка vLLM находится в разработке. Весы модели доступны на Hugging Face по адресу CohereLabs/North-Micro-Vision-Instruct.

Источник: Huggingface ↗