В мире искусственного интеллекта, где гонка за параметрами часто приводит к созданию всё более массивных и ресурсоемких моделей, компания Ant Group, через свою дочернюю структуру Robbyant, предлагает свежий взгляд на фундаментальные задачи компьютерного зрения. Они представили LingBot-Vision — семейство самообучаемых Vision Transformers (ViT), спроектированных специально для плотного пространственного восприятия. Это не просто еще одна модель для распознавания изображений; это архитектурный сдвиг, который ставит в центр внимания то, что традиционные модели часто игнорируют: границы, контуры и глубинные структуры сцен.
До сих пор большинство фундаментальных моделей зрения обучались на принципе семантической инвариантности. Их главная задача — ответить на вопрос «что» находится на изображении, при этом намеренно отбрасывая мелкомасштабную пространственную структуру. Для классификации кота или машины это не важно. Но для робота, которому нужно навигировать в сложной среде, или для системы автономного вождения, где критически важно различать границы объектов, глубину и разрывы в пространстве, такая «слепота» к структуре становится фатальной. LingBot-Vision инвертирует этот приоритет, делая границы нативным сигналом для предварительного обучения.
Результатом стал бэкбон на 1 миллиард параметров, который демонстрирует результаты, сопоставимые с моделями в 7 раз больше, включая знаменитую DINOv3 (7B). В этой статье мы подробно разберем, как работает новая архитектура, почему подход «masked boundary modeling» меняет правила игры, и как разработчики в России и мире могут использовать эти возможности для своих проектов.
01Что такое LingBot-Vision и почему это важно?
LingBot-Vision — это предварительно обученный энкодер с самообучением, предназначенный для задач, требующих понимания пространственной структуры. Флагманская модель ViT-g/16 содержит около 1,1 миллиарда параметров. Её ключевая особенность заключается в методе обучения: она использует новую цель под названием masked boundary modeling (моделирование маскированных границ) на корпусе из примерно 161 миллиона изображений. Эти данные были отобраны из пула в 2 миллиарда веб-изображений, причем без использования человеческих меток, внешних детекторов краев или предварительно обученных бэкбонов для начальной инициализации.
Важно отметить экономичность этого подхода. Корпус данных на порядок меньше, чем у DINOv3 (который использует LVD-1689M), а модель потребляет менее трети обучающих выборок DINOv3. Это означает, что LingBot-Vision достигает высокой точности при значительно меньших вычислительных затратах на этапе обучения. Энкодер выдает плотные функции патч-токенов, предназначенные для использования с замороженными считывающими устройствами (frozen readouts). Для развертывания в условиях ограниченных ресурсов флагманская модель была дистиллирована в три версии меньшего размера: ViT-L (300M), ViT-B (86M) и ViT-S, которые показывают отличные результаты в своих классах.
02Как работает Masked Boundary Modeling?
Методология LingBot-Vision строится на парадигме само-дистилляции DINO/iBOT, где учитель (копия студента с экспоненциальным скользящим средним, EMA) генерирует целевые значения в реальном времени, а студент пытается их восстановить из замаскированных представлений. Однако стандартное маскирование изображений скрывает патчи случайным образом, игнорируя содержание каждого патча. Плоский внутренний патч легко восстановить по соседям, но патч, пересекающий границу объекта, несет в себе структуру, которую один контекст обеспечить не может.
Границы — это наименее избыточные и наиболее информативные регионы изображения. Обычное маскирование относится к ним так же, как к любым другим, что является упущенной возможностью. LingBot-Vision решает эту проблему с помощью двух ключевых идей:

1. Boundary-forcing (Принуждение границ)
Учитель предсказывает плотное поле границ онлайн и идентифицирует токены, содержащие границы, как множество B. Эти токены принудительно добавляются в набор маскированного студента поверх случайной маски M, создавая комбинированную маску M⁺ = M ∪ B. Замаскированные токены затем маршрутизируются по геометрии: токены границ получают явную геометрическую цель в дополнение к семантической цели само-дистилляции, в то время как внутренние замаскированные токены сохраняют только стандартную семантическую цель. Эта маршрутизация критически важна, потому что семантическая цель по своей природе неоднозначна именно там, где встречаются две области, тогда как геометрическая цель четко определена именно там, где обычное маскирование работает слабее. Это позволяет семантическим и геометрическим представлениям сосуществовать и развиваться вместе, а не конкурировать.
2. Категориальное поле границ
Границы моделируются как отрезки линий, поднятые в плотное поле: каждый близлежащий пиксель хранит вектор атрибутов a(p) = (d, θ, φ¹, φ²), записывающий его расстояние до ближайшего отрезка и три угла, которые его локализуют. Прямая регрессия этого поля в цикле «учитель-студент» приводит к коллапсу. Решение заключается в дискретизации каждого канала в K = 32 бина, превращая предсказание границ в классификацию на уровне пикселей. Это позволяет ветви границ использовать те же механизмы центрирования и усиления, которые стабилизируют современную само-дистилляцию.
Полная функция потерь суммирует четыре термина:
L = L_DINO + λᵢ · L_iBOT + λᵦ · L_bnd + λₖ · L_KoLeoГде L_DINO и L_iBOT отвечают за семантическую консистентность, L_bnd — за точность границ, а L_KoLeo — за равномерное распределение признаков (Kolev-KoLeo regularization), что помогает избежать коллапса представлений.
03Производительность и бенчмарки
Все результаты плотного прогнозирования ниже используют замороженные функции с одним линейным слоем, поэтому производительность attributable (приписывается) исключительно представлению, а не декодеру. Давайте посмотрим на сравнительные данные, которые впечатляют даже самых скептичных исследователей.
| Model | Params | NYUv2 RMSE ↓ | KITTI RMSE ↓ | ADE20K mIoU | Cityscapes mIoU | VOC mIoU |
|---|---|---|---|---|---|---|
| LingBot-Vision ViT-g | 1B/16 | 0.296 | 2.552 | 53.5 | 79.6 | 87.5 |
| DINOv3 | 7B/16 | 0.309 | 2.346 | 55.9 | 81.1 | 86.6 |
| V-JEPA 2.1 ViT-G | 2B/16 | 0.307 | 2.461 | 47.9 | 73.5 | 85.0 |
| AM-RADIOv2.5 | 1B/14 | 0.340 | 2.918 | 53.0 | 78.4 | 85.4 |
| DINOv2 | 1B/14 | 0.372 | 2.624 | 49.5 | 75.6 | 83.1 |
| SigLIP 2 | 1B/16 | 0.494 | 3.273 | 42.7 | 64.8 | 72.7 |
На датасете NYU-Depth v2 LingBot-Vision показывает лучший RMSE во всем сравнении (0.296), опережая 7-миллиардную DINOv3 (0.309) при примерно в 7 раз меньшем количестве параметров, а также 2-миллиардную V-JEPA 2.1 (0.307). На KITTI она является лучшей моделью среди моделей с количеством параметров менее 2B. На семантической сегментации она находится на уровне дистиллированной DINOv3 ViT-H+ — уступает на 1.3 mIoU на ADE20K, совпадает на Cityscapes и опережает на VOC12, улучшая результаты DINOv2 того же размера более чем на 4 mIoU на всех трех бенчмарках.

В сегментации видеообъектов (video object segmentation), которая использует обучение без меток через распространение меток по замороженным функциям, LingBot-Vision достигает 70.0 J&F на DAVIS-2017 и 73.5 на YouTube-VOS. Это сопоставимо с DINOv3 ViT-H+ (71.1 / 74.0) и 7B DINOv3 (71.1 / 74.1), и является лучшим результатом среди всех остальных моделей любого масштаба. Примечательно, что сами токены границ достаточно стабильны, чтобы отслеживаться в видео просто по косинусному сходству замороженных функций, без временного обучения.
04Компромиссы и преимущества дистилляции
Как и у любой архитектуры, у LingBot-Vision есть свои компромиссы. Основной компромисс касается распознавания на уровне изображения: линейное зондирование ImageNet-1K достигает 86.32, а k-NN — 83.39, что уступает DINOv3-7B, который тратит свою емкость на инвариантность на уровне изображения. Однако преимущества сохраняются и после дистилляции. Студент ViT-L (0.3B параметров) сопоставим с 7B DINOv3 на NYUv2 depth (0.310 против 0.309) при примерно в 23 раза меньшем количестве параметров. Это открывает невероятные возможности для развертывания на edge-устройствах и в робототехнике, где ресурсы ограничены.
05Практическое применение и запуск
Замороженные токены патчей служат для нескольких плотных рабочих нагрузок напрямую: оценка глубины читает геометрию прямо из функций, семантическая сегментация выигрывает от переходов функций, которые точно попадают на контуры объектов, а сегментация видеообъектов работает через сопоставление токенов по косинусному сходству. Энкодер также служит инициализацией для последующего обучения дополнению глубины (depth-completion).
Загрузка бэкбона следует официальной репозитории. Ниже приведен пример кода на Python, который демонстрирует, как инициализировать модель и получить токены патчей. Обратите внимание, что для работы требуется Python ≥ 3.10 и PyTorch ≥ 2.0. Для больших бэкбонов рекомендуется GPU, но модель также может работать на CPU, хотя и медленнее.
import torch
from lingbot_vision import load_pretrained_backbone, extract_patch_tokens, load_image
device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.bfloat16 if device == "cuda" else torch.float32
# Downloads model.pt from Hugging Face on first use.
backbone = load_pretrained_backbone(
variant="small", # giant | large | base | small; defaults to large
device=device,
dtype=dtype
)
img_norm = load_image(
"examples/example.png",
size=512,
patch_size=backbone.patch_size,
mode="square"
)
patch_tokens, patch_grid = extract_patch_tokens(
backbone,
img_norm,
device,
dtype
)
print(patch_tokens.shape, patch_grid, embed_dim)
# torch.Size([1, 1024, 384]) (32, 32) 384Аргумент variant выбирает размер и по умолчанию равен large. Выходные patch_tokens имеют форму [B, H*W, C]. Это позволяет легко интегрировать модель в существующие пайплайны компьютерного зрения, используя стандартные библиотеки PyTorch.
06LingBot-Depth 2.0: Последствия для downstream-задач
Чтобы показать, что дает энкодер, ориентированный на пространственное восприятие, команда обновила свою систему дополнения глубины до LingBot-Depth 2.0. Рецепт маскированного моделирования глубины остался неизменным с версии 1.0; изменились ровно два ингредиента: инициализация энкодера переключилась с DINOv2 на LingBot-Vision (в вариантах ViT-L и ViT-g), а курируемые обучающие данные выросли с 3 миллионов публично доступных образцов до 150 миллионов.

Эти два изменения привели к ведущим результатам по 14 бенчмаркам дополнения глубины, охватывающим режимы блочной маски, разреженности и реальных сенсоров. На блочно-замаскированном DIODE-Indoor RMSE уменьшился вдвое с 0.132 до 0.062. Система strongest (наиболее сильная) на захватах прозрачных объектов ClearGrasp (RMSE 0.010 / 0.012) — классическом случае отказа активного глубинного зондирования.
Примечательно, что два изменения комплементарны, а не взаимно исключают друг друга: по мере роста обучающих данных с 3M до 150M, кривая, инициализированная DINOv2, насыщается после 20 миллионов образцов, в то время как кривая LingBot-Vision продолжает улучшаться. Больше данных усиливает, а не размывает преимущество лучшей точки старта. Это доказывает, что качественная инициализация, основанная на понимании границ, позволяет модели эффективнее использовать большие объемы данных.
07Ключевые выводы
- LingBot-Vision делает границы нативным сигналом предварительного обучения, загружаясь с сырых изображений без меток, детекторов краев или предварительно обученных бэкбонов.
- Boundary-forcing плюс категориальное поле границ позволяют геометрии и семантике сосуществовать — и дают параметрически свободный тест NFA для валидации.
- 1B бэкбон показывает лучший RMSE на NYU-Depth v2 в своем сравнении, опережая 7B DINOv3, при этом обучаясь на корпусе данных, на порядок меньшем по размеру.
- Преимущества сохраняются после дистилляции: студент 0.3B ViT-L сопоставим с 7B DINOv3 на NYUv2 при ~23 раз меньшем количестве параметров.
- Замена только энкодера и масштабирование данных вывели LingBot-Depth 2.0 к ведущим результатам на 14 бенчмарках дополнения глубины, причем преимущество энкодера расширяется с ростом данных.
- Веса поставляются под лицензией Apache-2.0 в размерах ViT-g/L/B/S для любого бюджета развертывания.
08Что это значит на практике
Для разработчиков в России и СНГ, которые работают с робототехникой, автономными системами или компьютерным зрением в условиях ограниченных вычислительных ресурсов, LingBot-Vision представляет огромный интерес. Открытый код и веса под лицензией Apache-2.0 позволяют свободно использовать модель в коммерческих продуктах. Особенно перспективным выглядит использование версии ViT-L или ViT-S для задач, где критична точность определения границ объектов: например, в системах сортировки мусора, навигации дронов в сложных условиях или в медицинской визуализации, где контуры органов имеют решающее значение.
Экономия на вычислительных ресурсах при обучении и инференсе, а также способность модели работать с замороженными функциями, делают её отличным выбором для edge-устройств. Интеграция через стандартный PyTorch интерфейс минимизирует порог входа. Если вы ранее использовали DINOv2 или SigLIP для задач глубины или сегментации, замена энкодера на LingBot-Vision может стать простым способом получить значительный прирост точности без перестройки всей архитектуры декодера.
Открытие LingBot-Vision от Ant Group — это не просто еще одна модель в списке Hugging Face. Это сигнал о том, что будущее компьютерного зрения лежит не только в увеличении параметров, но и в более умных, физически обоснованных методах предварительного обучения. Игнорировать этот инструмент в своих проектах сейчас было бы упущенной возможностью.
Источник: MarkTechPost ↗
