Релиз модели8 июля 2026 г., 17:45 МСК🤖 Auto

SenseNova-Vision: Единая модель генерации для всех задач CV

OpenSenseNova представила SenseNova-Vision-7B-MoT — модель, объединяющую распознавание, сегментацию и 3D-геометрию в едином текстово-изображенном формате без специализированных заголовков.

Баннер новости 3121

Парадигма «Vision as Unified Multimodal Generation»

Лаборатория OpenSenseNova выпустила SenseNova-Vision — архитектуру, которая переосмысливает компьютерное зрение. Вместо традиционных отдельных модулей для детекции, глубины или сегментации, модель использует подход Unified Multimodal Generation (UMM). Гетерогенные визуальные задачи преобразуются в пространство генерации текста и изображений:

  • Текстовый вывод кодирует символические данные: bounding boxes, ключевые точки, OCR, параметры камеры.
  • Изображенческий вывод генерирует плотные карты: маски сегментации, карты глубины, нормали поверхностей.
  • Смешанный вывод позволяет комбинировать оба формата в одном ответе.

Ключевое архитектурное отличие: модель не требует task-specific prediction heads или дополнительных декодеров. Обучение проводилось на собственном корпусе SenseNova-Vision Corpus-50M, содержащем 50 миллионов примеров инструкций и ответов.

Технические характеристики и запуск

Первая версия весов доступна под названием SenseNova-Vision-7B-MoT. Для работы с полной функциональностью и веб-демо требуется GPU с 80 ГБ памяти (один чип для демо, кластер из 8 чипов для бенчмарков). Код и технический отчет опубликованы на GitHub.

Результаты бенчмарков: Структурное понимание

В задачах структурированного понимания (детекция, OCR, GUI, ключевые точки) SenseNova-Vision демонстрирует лидерские позиции, превосходя такие модели, как Qwen3-VL-8B и LocateAnything. Ниже приведено сравнение метрик на ключевых датасетах:

Метрика / Модель Object Detection (COCO) OCR (HR/RefCOCOg) GUI (ScreenSpot-V2) Keypoint (COCO-Kpt.)
Qwen3-VL-8B-Instruct 46.6 70.4 / 72.3 / 72.6 43.2 35.7
LocateAnything 54.7 78.7 / 76.7 / 77.6 50.7 60.4
SenseNova-Vision 56.6 80.2 79.6 66.8

Плотная геометрическая предикция и сегментация

В задачах оценки глубины (Depth) и нормалей (Normal) модель показывает результаты, сопоставимые с узкоспециализированными решениями вроде DepthAnything V2 и Marigold. В сегментации (Ref. Seg.) SenseNova-Vision достигает 81.3 на RefCOCO, что выше показателей PSALM (66.6) и Text4Seg (79.2).

Метрика / Модель Depth NYUv2 (AbsRel↓ / δ1↑) Normal NYUv2 (Mean↓ / δ1↑) Ref. Seg. (cIoU)
DepthAnything V2 4.5 / 97.9 -- --
Marigold 5.5 / 96.4 21.3 / 45.6 --
SenseNova-Vision 4.0 / 98.1 12.8 / 68.9 81.3

Многовидовая геометрия (Multi-View)

Модель также справляется с реконструкцией 3D-точек и оценкой позы камеры. На датасете 7Scenes по метрике F1 (Acc.↓ / Comp.↓ / F1↑) SenseNova-Vision показывает 87.9, что близко к лидеру DUSt3R (87.1) и значительно лучше G2VLM (59.2). Это подтверждает способность модели удерживать пространственные связи при генерации «изображений» 3D-сцены.

Источник: Github ↗