В мире компьютерного зрения и видеоаналитики существует вечная проблема: как отследить объект, который перемещается из зоны видимости одной камеры в зону видимости другой? Традиционные системы 2D-трекинга, работающие на одной камере, часто теряют объект, когда он покидает кадр, и не могут предоставить информацию о глубине. Это критическое ограничение делает их непригодными для сложных сценариев, таких как мониторинг безопасности на складах, аналитика ритейла или управление умными зданиями, где требуется непрерывный и точный учет перемещений людей и техники.
Компания NVIDIA представила решение этой проблемы в обновлении DeepStream 9.1. Новая версия платформы вводит два ключевых компонента: AutoMagicCalib (AMC) для автоматизации калибровки камер и Multi-View 3D Tracking (MV3DT) для объединения данных с нескольких камер в единую 3D-систему координат. Это позволяет не только отслеживать объекты, но и присваивать им глобально уникальный идентификатор, независимо от того, через какую камеру они проходят. В этой статье мы подробно разберем архитектуру этих технологий, процесс их настройки и то, как разработчики могут использовать AI-агентов для быстрого развертывания таких систем.

01Почему традиционные методы 2D-трекинга больше не работают
Для понимания ценности нового подхода важно осознать ограничения старых решений. Однокамерный 2D-трекинг работает в плоскости изображения. Когда объект выходит за пределы кадра, система теряет его. Даже если объект возвращается, система часто не может понять, что это тот же самый человек или автомобиль, так как у нее нет контекста о его местоположении в пространстве. Кроме того, 2D-трекинг не предоставляет информацию о глубине, что делает невозможным измерение расстояний или построение точных траекторий в реальном мире.
Существующие методы 3D-трекинга, которые могли бы решить эти проблемы, требуют сложной ручной калибровки камер. Инженерам необходимо физически размещать калибровочные паттерны (например, шахматные доски) в зоне видимости камер, выполнять множество снимков и вручную настраивать параметры проекции. Этот процесс не только трудоемок, но и прерывает работу систем, а также требует специального оборудования. Ошибки в калибровке приводят к неточностям в отслеживании, что недопустимо в промышленных приложениях.
02Что нового в NVIDIA DeepStream 9.1
DeepStream 9.1 — это не просто обновление версии, а значительный шаг вперед в упрощении разработки систем компьютерного зрения. Платформа делает упор на модульность, автоматизацию и производительность на периферийных устройствах (edge). Ключевыми нововведениями стали:
- 13 агентских навыков (Agentic Skills): Набор инструментов, предназначенных для использования с AI-кодингом-агентами, такими как Claude Code или Codex. Это позволяет разработчикам описывать задачи на естественном языке, а не писать сотни строк конфигурационного кода вручную.
- Навык MV3DT: Полностью автоматизированный конвейер для точного отслеживания объектов в 3D-пространстве с использованием данных с нескольких камер.
- Навык AMC (AutoMagicCalib): Инструмент, который автоматически оценивает внутренние и внешние параметры камер, устраняя необходимость в ручной калибровке.
- Поддержка JetPack 7.2: Оптимизация для работы на периферийных устройствах NVIDIA Jetson, таких как Orin и Thor, обеспечивая высокую производительность при низком энергопотреблении.
- Открытый исходный код: Все исходные коды и эталонные приложения доступны в едином репозитории GitHub, что упрощает внедрение и кастомизацию.

03Архитектура системы Multi-View 3D Tracking (MV3DT)
Система MV3DT расширяет стандартный трекер DeepStream, добавляя поддержку распределенного многовидового 3D-трекинга. Давайте разберем, как данные протекают через эту систему, шаг за шагом.
1. Возможности обнаружения (Detection Capabilities)
Пайплайн DeepStream обрабатывает потоки со всех камер одновременно. Трекер MV3DT независимо обнаруживает и отслеживает объекты в каждом виде. Платформа поддерживает три модели детекторов «из коробки»:
- PeopleNetTransformer: Детектор людей на основе трансформеров. Это модель по умолчанию для сцен с пешеходами, обеспечивающая высокую точность.
- PeopleNet v2.6.3: Высокоэффективный детектор, основанный на архитектуре DetectNet_v2. Отлично подходит для сценариев, где важна скорость обработки.
- RT-DETR 2D: Многоклассовой детектор, идеальный для промышленных сред. Он способен различать не только людей, но и погрузчики, транспортные средства и другое оборудование.
2. Монокулярное 3D-восприятие (Monocular 3D Perception)
Каждая камера использует матрицу проекции 3×4, которая хранится в файле калибровки YAML. Эта матрица позволяет «обратной проекции» (back-project) 2D-ограничивающих рамок (bounding boxes) из изображения в 3D-координаты мирового пространства. Система использует предположение о плоской земле (ground-plane assumption) для расчета глубины, что позволяет определить положение объекта относительно пола.

3. Многовидовая ассоциация (Multi-View Association)
Это сердце системы. Когда два разных камеры наблюдают одного и того же человека, алгоритм ассоциации должен понять, что это один и тот же объект. Для этого используется протокол MQTT (Message Queuing Telemetry Transport) — легкий протокол «издатель-подписчик», который позволяет трекерам обмениваться данными о следах (tracklets) между камерами. Алгоритм сопоставляет эти следы, используя их близость в 3D-мировом пространстве, и присваивает единый глобально согласованный идентификатор объекта (Global Object ID).
4. Вывод данных (Output)
Результаты трекинга поступают в трех форматах:
- On-Screen Display (OSD): Живая сетка видеопотоков с наложенными 2D и 3D рамками и общими идентификаторами. Это удобно для визуального мониторинга оператором.
- Bird’s-Eye View (BEV): Карта вида сверху в реальном времени, показывающая траектории объектов в мировых координатах. Эта карта накладывается на изображение планировки помещения.
- Kafka Messaging: Структурированные метаданные (protobuf) для каждого кадра, включающие ID сенсора, ID объекта и 3D-рамку. Эти данные отправляются в Kafka для использования другими приложениями (например, для аналитики или управления роботами).
04Автоматическая калибровка с помощью AutoMagicCalib (AMC)
Для работы MV3DT камеры должны быть точно откалиброваны, чтобы правильно сопоставлять пиксели изображения с координатами в мире. AMC решает эту задачу, анализируя видео с уже отслеживаемыми объектами. Вместо шахматных досок AMC использует движение людей или техники в кадре.
Процесс калибровки AMC состоит из нескольких этапов:
- Извлечение траекторий для каждой камеры: DeepStream обнаруживает и отслеживает объекты в каждом видео. AMC собирает эти данные о траекториях.
- Калибровка и выпрямление для одного вида: Для каждой камеры независимо AMC оценивает внутренние параметры (фокусное расстояние, главная точка, искажения линз) на основе траекторий и создает выпрямленное изображение.
- Сопоставление треков между видами: AMC сопоставляет треки объектов между разными камерами. Для этого пользователь должен вручную указать несколько точек выравнивания, выбрав соответствующие ориентиры на видах камер и на карте планировки.
- Пакетная оптимизация (Bundle Adjustment): Все параметры камер совместно уточняются для минимизации ошибки перепроекции глобально. Это обеспечивает максимальную точность.
- Опциональная калибровка VGGT: Пользователи могут использовать модель Visual Geometry Grounded Transformer (VGGT) для дополнительной точности, особенно если движение объектов ограничено. VGGT использует обученные модели геометрии для более надежных результатов.
AMC доступен как микросервис с REST API и веб-интерфейсом. Пользователю нужно только предоставить изображение планировки и определить несколько точек выравнивания.

05Развертывание приложений с помощью AI-агентов
Одной из самых мощных особенностей DeepStream 9.1 является интеграция с AI-кодинг-агентами. Вместо того чтобы вручную писать скрипты и редактировать конфигурационные файлы, разработчик может использовать естественный язык. Агент (например, Claude Code или Codex) понимает запрос, настраивает окружение, запускает контейнеры и выполняет калибровку.
Необходимые условия (Prerequisites)
Для работы потребуется:
- Операционная система Ubuntu 24.04 (x86_64).
- Драйвер NVIDIA версии 580 или выше.
- Docker с NVIDIA Container Toolkit.
- Установленный и аутентифицированный Claude Code или Codex.
- Ключ API NGC (для загрузки контейнеров DeepStream и AMC с nvcr.io).
- Ключ Hugging Face (для загрузки модели VGGT, если используется).
- Дисплей X11 или VNC (опционально, для визуализации; в безголовом режиме вывод сохраняется в видеофайлы).
Шаг 1: Клонирование репозитория и установка навыков
Сначала нужно клонировать репозиторий DeepStream и скопировать навыки в директорию вашего AI-агента. Путь зависит от используемого агента:
git clone https://github.com/NVIDIA/DeepStream.git
cd DeepStream
# Пример для Codex (адаптируйте путь для вашего агента):
mkdir -p ~/.codex/skills
cp -r skills/* ~/.codex/skills/Навыки также можно установить на уровне рабочего пространства (scoped to a single project). Подробности см. в README репозитория.
Шаг 2: Запуск AI-агента
Из корня репозитория DeepStream запустите вашего агента:
claude
# или
codexТеперь вы можете взаимодействовать с агентом, используя естественный язык.
06Практический сценарий A: Запуск на тестовом наборе данных
Для начала можно использовать встроенные тестовые наборы данных, которые уже содержат калибровку. В репозитории есть наборы для 4 и 12 камер. Давайте запустим систему на 12 камерах. Введите в чат с агентом следующую команду:
Sample prompt: deploy mv3dt on the 12-camera sample dataset
Агент выполнит следующие действия:
- Проверит наличие доступа к дисплею (X11/VNC) и определит, работает ли система в безголовом режиме.
- Попросит разрешения на запуск привилегированных команд Docker (например,
sudo xhost +). - Запустит скрипт настройки, который загрузит модели, запустит сервисы Kafka и Mosquitto, и подготовит пайплайн.
- Запустит контейнер DeepStream и начнет трекинг. Первый запуск может занять несколько минут, так как происходит сборка и загрузка моделей.
Если дисплей доступен, откроются два окна:
- DeepStreamTest5App: Плиточная сетка из 12 видеопотоков с 2D и 3D рамками.
- Bird’s-Eye View: Карта траекторий в реальном времени.
В безголовом режиме агент сгенерирует видеофайлы: tiled_display_raw.mp4 (сетка камер) и видео траекторий BEV.
07Практический сценарий B: Запуск на собственных камерах с калибровкой AMC
Если у вас есть свои синхронизированные видеопотоки, которые еще не откалиброваны, процесс будет немного сложнее, но все еще автоматизирован. Предположим, у вас есть папка с видеофайлами, названными последовательно (например, cam_00.mp4, cam_01.mp4), и изображение планировки layout.png.
Введите в чат с агентом:
Sample prompt: deploy mv3dt on these videos ~/my-camera-dataset/videos
Агент выполнит следующие шаги:
- Проверит папку с видео.
- Обнаружит отсутствие файлов калибровки
camInfo/*.ymlи автоматически запустит процесс калибровки AMC. - Запустит микросервис AMC и предоставит ссылку на веб-интерфейс.
После этого AMC запустит полный цикл калибровки: извлечение траекторий, выпрямление, сопоставление треков и пакетную оптимизацию. Агент будет опрашивать статус и, когда калибровка завершится, загрузит совместимые с MV3DT файлы YAML в папку ~/my-camera-dataset/camInfo/. Затем система автоматически запустит MV3DT на ваших данных.
08Что это значит на практике
Внедрение NVIDIA DeepStream 9.1 с функциями AMC и MV3DT меняет парадигму разработки систем компьютерного зрения. Раньше создание многокамерной системы 3D-трекинга требовало команды инженеров, которые неделями настраивали калибровку и писали сложный код для ассоциации объектов. Теперь этот процесс можно описать несколькими предложениями на естественном языке, а AI-агент выполнит техническую работу.
Для бизнеса это означает:
- Сокращение времени выхода на рынок (Time-to-Market): Развертывание систем безопасности или аналитики занимает часы, а не недели.
- Повышение точности: Автоматическая калибровка AMC исключает человеческие ошибки, а алгоритм MV3DT обеспечивает стабильные идентификаторы объектов.
- Масштабируемость: Модульная архитектура позволяет легко добавлять новые камеры и детекторы.
- Доступность для разработчиков: Интеграция с AI-агентами снижает порог входа, позволяя разработчикам, не являющимся экспертами в низкоуровневом программировании, создавать сложные системы.
Эти технологии открывают новые возможности для ритейла, логистики, производства и умных городов, где критически важно понимать не только «кто» находится в кадре, но и «где» он находится в пространстве и «куда» движется.
Таким образом, NVIDIA DeepStream 9.1 не просто добавляет новые функции, а предоставляет полноценную экосистему для быстрого и надежного развертывания передовых систем компьютерного зрения, делая технологии 3D-трекинга доступными для широкого круга разработчиков.
Источник: NVIDIA Developer ↗
