Парадигма «Vision as Unified Multimodal Generation»
Лаборатория OpenSenseNova выпустила SenseNova-Vision — архитектуру, которая переосмысливает компьютерное зрение. Вместо традиционных отдельных модулей для детекции, глубины или сегментации, модель использует подход Unified Multimodal Generation (UMM). Гетерогенные визуальные задачи преобразуются в пространство генерации текста и изображений:
- Текстовый вывод кодирует символические данные: bounding boxes, ключевые точки, OCR, параметры камеры.
- Изображенческий вывод генерирует плотные карты: маски сегментации, карты глубины, нормали поверхностей.
- Смешанный вывод позволяет комбинировать оба формата в одном ответе.
Ключевое архитектурное отличие: модель не требует task-specific prediction heads или дополнительных декодеров. Обучение проводилось на собственном корпусе SenseNova-Vision Corpus-50M, содержащем 50 миллионов примеров инструкций и ответов.
Технические характеристики и запуск
Первая версия весов доступна под названием SenseNova-Vision-7B-MoT. Для работы с полной функциональностью и веб-демо требуется GPU с 80 ГБ памяти (один чип для демо, кластер из 8 чипов для бенчмарков). Код и технический отчет опубликованы на GitHub.
Результаты бенчмарков: Структурное понимание
В задачах структурированного понимания (детекция, OCR, GUI, ключевые точки) SenseNova-Vision демонстрирует лидерские позиции, превосходя такие модели, как Qwen3-VL-8B и LocateAnything. Ниже приведено сравнение метрик на ключевых датасетах:
| Метрика / Модель | Object Detection (COCO) | OCR (HR/RefCOCOg) | GUI (ScreenSpot-V2) | Keypoint (COCO-Kpt.) |
|---|---|---|---|---|
| Qwen3-VL-8B-Instruct | 46.6 | 70.4 / 72.3 / 72.6 | 43.2 | 35.7 |
| LocateAnything | 54.7 | 78.7 / 76.7 / 77.6 | 50.7 | 60.4 |
| SenseNova-Vision | 56.6 | 80.2 | 79.6 | 66.8 |
Плотная геометрическая предикция и сегментация
В задачах оценки глубины (Depth) и нормалей (Normal) модель показывает результаты, сопоставимые с узкоспециализированными решениями вроде DepthAnything V2 и Marigold. В сегментации (Ref. Seg.) SenseNova-Vision достигает 81.3 на RefCOCO, что выше показателей PSALM (66.6) и Text4Seg (79.2).
| Метрика / Модель | Depth NYUv2 (AbsRel↓ / δ1↑) | Normal NYUv2 (Mean↓ / δ1↑) | Ref. Seg. (cIoU) |
|---|---|---|---|
| DepthAnything V2 | 4.5 / 97.9 | -- | -- |
| Marigold | 5.5 / 96.4 | 21.3 / 45.6 | -- |
| SenseNova-Vision | 4.0 / 98.1 | 12.8 / 68.9 | 81.3 |
Многовидовая геометрия (Multi-View)
Модель также справляется с реконструкцией 3D-точек и оценкой позы камеры. На датасете 7Scenes по метрике F1 (Acc.↓ / Comp.↓ / F1↑) SenseNova-Vision показывает 87.9, что близко к лидеру DUSt3R (87.1) и значительно лучше G2VLM (59.2). Это подтверждает способность модели удерживать пространственные связи при генерации «изображений» 3D-сцены.
Источник: Github ↗
