Релиз модели8 июля 2026 г., 06:16 МСК🤖 Auto

Ant Group открыла LingBot-Vision: 1B-модель для плотного пространственного восприятия

Robbyant (Ant Group) выпустила под Apache 2.0 модель LingBot-Vision, которая превосходит DINOv3 (7B) в оценке глубины, используя метод маскирования границ.

Баннер новости 3077

Суть прорыва: Границы вместо семантики

Большинство современных визуальных фундаментальных моделей (VFM) обучаются на семантической инвариантности, игнорируя тонкую пространственную структуру — контуры объектов и перепады глубины. LingBot-Vision от Robbyant (дочерняя компания Ant Group) инвертирует этот подход. Модель использует 1.1B параметров (ViT-g/16) и обучается с помощью новой задачи Masked Boundary Modeling на корпусе из 161 млн изображений. Это в 10 раз меньше датасета DINOv3, а потребление вычислительных ресурсов — менее чем в 3 раза ниже.

Техническая реализация: Boundary-forcing

Ключевая инновация — разделение токенов на «границы» и «внутренние области». Учитель (teacher) предсказывает плотное поле границ, и токены, содержащие структурную информацию, принудительно добавляются в маску (M⁺ = M ∪ B). Это позволяет модели учить геометрические признаки там, где обычное семантическое маскирование дает сбой. Поле границ дискретизируется в 32 бина, что позволяет использовать параметрически свободный тест NFA (Number-of-False-Alarms) для валидации структур без дополнительных затрат.

Результаты бенчмарков

Модель демонстрирует выдающиеся результаты в задачах плотного восприятия (depth estimation, segmentation), используя замороженные признаки и один линейный слой. Ниже представлено сравнение с ключевыми конкурентами:

Модель Параметры NYUv2 RMSE (↓) KITTI RMSE (↓) ADE20K mIoU Cityscapes mIoU
LingBot-Vision ViT-g 1.1B 0.296 2.552 53.5 79.6
DINOv3 7B 0.309 2.346 55.9 81.1
V-JEPA 2.1 ViT-G 2B 0.307 2.461 47.9 73.5
DINOv2 1B 0.372 2.624 49.5 75.6

На датасете NYU-Depth v2 LingBot-Vision показала лучший результат (0.296), превзойдя 7-миллиардную DINOv3 (0.309) при семикратной экономии параметров. В сегментации видео (DAVIS-2017) модель достигла 70.0 J&F, что сопоставимо с DINOv3.

Дистилляция и применение

Флагманская модель дистиллирована в три версии меньшего размера: ViT-L (300M), ViT-B (86M) и ViT-S. Примечательно, что 0.3B-версия (ViT-L) повторяет точность DINOv3 на NYUv2 (0.310 vs 0.309) при 23-кратном уменьшении размера. Модель доступна на Hugging Face под лицензией Apache-2.0 и готова к использованию в робототехнике, автономных системах и задачах оценки глубины.

Источник: MarkTechPost ↗