Суть прорыва: Границы вместо семантики
Большинство современных визуальных фундаментальных моделей (VFM) обучаются на семантической инвариантности, игнорируя тонкую пространственную структуру — контуры объектов и перепады глубины. LingBot-Vision от Robbyant (дочерняя компания Ant Group) инвертирует этот подход. Модель использует 1.1B параметров (ViT-g/16) и обучается с помощью новой задачи Masked Boundary Modeling на корпусе из 161 млн изображений. Это в 10 раз меньше датасета DINOv3, а потребление вычислительных ресурсов — менее чем в 3 раза ниже.
Техническая реализация: Boundary-forcing
Ключевая инновация — разделение токенов на «границы» и «внутренние области». Учитель (teacher) предсказывает плотное поле границ, и токены, содержащие структурную информацию, принудительно добавляются в маску (M⁺ = M ∪ B). Это позволяет модели учить геометрические признаки там, где обычное семантическое маскирование дает сбой. Поле границ дискретизируется в 32 бина, что позволяет использовать параметрически свободный тест NFA (Number-of-False-Alarms) для валидации структур без дополнительных затрат.
Результаты бенчмарков
Модель демонстрирует выдающиеся результаты в задачах плотного восприятия (depth estimation, segmentation), используя замороженные признаки и один линейный слой. Ниже представлено сравнение с ключевыми конкурентами:
| Модель | Параметры | NYUv2 RMSE (↓) | KITTI RMSE (↓) | ADE20K mIoU | Cityscapes mIoU |
|---|---|---|---|---|---|
| LingBot-Vision ViT-g | 1.1B | 0.296 | 2.552 | 53.5 | 79.6 |
| DINOv3 | 7B | 0.309 | 2.346 | 55.9 | 81.1 |
| V-JEPA 2.1 ViT-G | 2B | 0.307 | 2.461 | 47.9 | 73.5 |
| DINOv2 | 1B | 0.372 | 2.624 | 49.5 | 75.6 |
На датасете NYU-Depth v2 LingBot-Vision показала лучший результат (0.296), превзойдя 7-миллиардную DINOv3 (0.309) при семикратной экономии параметров. В сегментации видео (DAVIS-2017) модель достигла 70.0 J&F, что сопоставимо с DINOv3.
Дистилляция и применение
Флагманская модель дистиллирована в три версии меньшего размера: ViT-L (300M), ViT-B (86M) и ViT-S. Примечательно, что 0.3B-версия (ViT-L) повторяет точность DINOv3 на NYUv2 (0.310 vs 0.309) при 23-кратном уменьшении размера. Модель доступна на Hugging Face под лицензией Apache-2.0 и готова к использованию в робототехнике, автономных системах и задачах оценки глубины.
Источник: MarkTechPost ↗
