Новое поколение компьютерного зрения для Edge
Разработчики из семейства LingBot анонсировали два ключевых обновления в области компьютерного зрения, ориентированных на ресурсоограниченные устройства. В центре внимания — LingBot-Vision и LingBot-Depth 2.0. Эти модели созданы не просто для классификации объектов, а для глубокого понимания пространственной структуры сцены, что критически важно для робототехники и мобильных платформ.
LingBot-Vision: Геометрия вместо семантики
Основная задача LingBot-Vision — определение границ объектов, глубины и геометрии сцены. В отличие от традиционных моделей, которые отвечают на вопрос «что на фото», эта архитектура фокусируется на «где края и как далеко находятся объекты».
Ключевые особенности модели:
- Гибкая масштабируемость: Доступны четыре размера модели — от 13 миллионов до 1.1 миллиарда параметров.
- Self-supervised обучение: Модель обучается без ручной разметки данных, что снижает затраты на подготовку датасетов.
- Эффективность: По заявлению разработчиков, LingBot-Vision превосходит модель DINOv3 при кратно меньшем количестве параметров.
Модель распространяется под лицензией Apache-2.0, а веса открыты для сообщества. Это делает её привлекательной для внедрения в робототехнику и мобильные приложения, где важна скорость инференса.
LingBot-Depth 2.0: 3D-картирование в сложных условиях
Вторая новинка — LingBot-Depth 2.0 — специализируется на оценке глубины по изображениям и построении 3D-карт сцены. Модель демонстрирует устойчивость к сложным текстурам, прозрачным объектам и условиям слабого освещения.
Архитектура учитывает семантику сцены и поддерживает мультимодальные входы (комбинация RGB-изображений и дополнительных признаков), что повышает точность реконструкции в реальном мире.
Сравнение характеристик
Для наглядности сравним представленные модели с упомянутым в источнике эталоном:
| Характеристика | LingBot-Vision | LingBot-Depth 2.0 | DINOv3 (референс) |
|---|---|---|---|
| Основная задача | Геометрия, границы, глубина | Оценка глубины, 3D-карта | Семантическое представление (ViT) |
| Размер модели | 13M – 1.1B параметров | Не указано (оптимизировано для edge) | Обычно >100M параметров |
| Тип обучения | Self-supervised (без разметки) | Не указано | Self-supervised |
| Лицензия | Apache-2.0 (открытые веса) | Не указано | Не указано |
| Применение | Роботы, мобильные устройства | Мобильные устройства, edge | Базовые модели для CV задач |
Почему это важно
Тренд на локальную обработку данных (on-device AI) требует моделей, которые не только точны, но и легковесны. Открытие весов LingBot-Vision под лицензией Apache-2.0 снимает барьеры для коммерческого использования. Способность работать с мультимодальными входами и в сложных условиях освещения делает LingBot-Depth 2.0 перспективным инструментом для автономных систем навигации и дронов.
Разработчики разместили исходный код и веса на GitHub и Hugging Face, что позволяет исследователям и инженерам сразу приступить к интеграции моделей в свои проекты.
Источник: Robbyant ↗
