AI-новости10 июля 2026 г., 21:46 МСК🤖 Auto

LingBot-Vision и Depth 2.0: легковесные модели для роботов и edge-устройств

Команда LingBot представила новые компьютерные модели: Vision для понимания геометрии сцены и Depth 2.0 для построения 3D-карт. Обе оптимизированы для мобильных устройств и работают с меньшим числом параметров, чем аналоги.

Баннер новости 3330

Новое поколение компьютерного зрения для Edge

Разработчики из семейства LingBot анонсировали два ключевых обновления в области компьютерного зрения, ориентированных на ресурсоограниченные устройства. В центре внимания — LingBot-Vision и LingBot-Depth 2.0. Эти модели созданы не просто для классификации объектов, а для глубокого понимания пространственной структуры сцены, что критически важно для робототехники и мобильных платформ.

LingBot-Vision: Геометрия вместо семантики

Основная задача LingBot-Vision — определение границ объектов, глубины и геометрии сцены. В отличие от традиционных моделей, которые отвечают на вопрос «что на фото», эта архитектура фокусируется на «где края и как далеко находятся объекты».

Ключевые особенности модели:

  • Гибкая масштабируемость: Доступны четыре размера модели — от 13 миллионов до 1.1 миллиарда параметров.
  • Self-supervised обучение: Модель обучается без ручной разметки данных, что снижает затраты на подготовку датасетов.
  • Эффективность: По заявлению разработчиков, LingBot-Vision превосходит модель DINOv3 при кратно меньшем количестве параметров.

Модель распространяется под лицензией Apache-2.0, а веса открыты для сообщества. Это делает её привлекательной для внедрения в робототехнику и мобильные приложения, где важна скорость инференса.

LingBot-Depth 2.0: 3D-картирование в сложных условиях

Вторая новинка — LingBot-Depth 2.0 — специализируется на оценке глубины по изображениям и построении 3D-карт сцены. Модель демонстрирует устойчивость к сложным текстурам, прозрачным объектам и условиям слабого освещения.

Архитектура учитывает семантику сцены и поддерживает мультимодальные входы (комбинация RGB-изображений и дополнительных признаков), что повышает точность реконструкции в реальном мире.

Сравнение характеристик

Для наглядности сравним представленные модели с упомянутым в источнике эталоном:

Характеристика LingBot-Vision LingBot-Depth 2.0 DINOv3 (референс)
Основная задача Геометрия, границы, глубина Оценка глубины, 3D-карта Семантическое представление (ViT)
Размер модели 13M – 1.1B параметров Не указано (оптимизировано для edge) Обычно >100M параметров
Тип обучения Self-supervised (без разметки) Не указано Self-supervised
Лицензия Apache-2.0 (открытые веса) Не указано Не указано
Применение Роботы, мобильные устройства Мобильные устройства, edge Базовые модели для CV задач

Почему это важно

Тренд на локальную обработку данных (on-device AI) требует моделей, которые не только точны, но и легковесны. Открытие весов LingBot-Vision под лицензией Apache-2.0 снимает барьеры для коммерческого использования. Способность работать с мультимодальными входами и в сложных условиях освещения делает LingBot-Depth 2.0 перспективным инструментом для автономных систем навигации и дронов.

Разработчики разместили исходный код и веса на GitHub и Hugging Face, что позволяет исследователям и инженерам сразу приступить к интеграции моделей в свои проекты.

Источник: Robbyant ↗