Мир компьютерного зрения и видеоналитики стоит на пороге новой эры, где границы между разработчиком и алгоритмом стираются. Компания NVIDIA, давно задающая стандарты в области ускоренных вычислений и ИИ, представила обновление своей флагманской платформы для потоковой аналитики — DeepStream версии 9.1. Это не просто очередная итерация с исправлением багов; это фундаментальный сдвиг в парадигме создания систем видеонаблюдения и аналитики. Главная инновация заключается в интеграции агентов искусственного интеллекта (Agentic AI) непосредственно в процесс разработки, что позволяет переводить проекты от концепции к работающему пайплайну с беспрецедентной скоростью.
До сих пор одна из самых болезненных проблем в индустрии — отслеживание одного объекта через множество камер — требовала ручных усилий. Инженерам приходилось вручную калибровать камеры, выполнять сложные геометрические вычисления и настраивать параметры сопоставления данных. DeepStream 9.1 предлагает элегантное решение этой проблемы через два ключевых компонента: Multi-View 3D Tracking (MV3DT) и AutoMagicCalib (AMC). Но самое интересное здесь не только в самих технологиях, но и в том, как они поставляются: как «навыки» (skills) для кодовых агентов. Это означает, что разработчик может описать задачу на естественном языке, а ИИ-агент самостоятельно соберет конфигурацию, запустит сервисы и настроит систему.
01Что такое DeepStream 9.1 и почему это важно?
Чтобы понять масштаб обновления, нужно вернуться к основам. DeepStream — это набор инструментов NVIDIA для потоковой аналитики, основанный на ИИ, предназначенный для понимания видео и изображений. В основе платформы лежит фреймворк GStreamer, который обеспечивает поддержку многопоточной и многомодельной инференс-обработки на графических процессорах NVIDIA. Типичный пайплайн DeepStream объединяет аппаратно ускоренное декодирование и кодирование, инференс через TensorRT, отслеживание объектов и интеграцию с брокерами сообщений. Это мощный конструктор, который позволяет создавать сложные системы видеоналитики без написания низкоуровневого кода для работы с видео-потоками.
Версия 9.1 расширяет этот базис, добавляя пять значимых улучшений. Во-первых, это поддержка агентов ИИ (agentic skills), которые автоматизируют рутинные задачи настройки. Во-вторых, внедрение навыка MV3DT для кросс-камерного отслеживания. В-третьих, автоматизированная калибровка через AMC. В-четвертых, поддержка JetPack 7.2 для edge-устройств Jetson Orin и Thor. И, наконец, унификация репозитория на GitHub под лицензиями CC-BY-4.0 и Apache-2.0, что делает платформу более открытой и доступной для сообщества.

02Как работает MV3DT: От 2D к согласованному 3D
Навык Multi-View 3D Tracking (MV3DT) является центральным элементом обновления. Его задача — спроецировать обнаружения из нескольких откалиброванных камер в единую систему координат 3D, ассоциировать наблюдения одного и того же объекта с разных ракурсов и присвоить ему один глобально уникальный идентификатор. Это решает проблему, когда один и тот же человек или транспортное средство получает разные ID в разных камерах, что делает аналитику бессмысленной.
Процесс обработки данных в MV3DT состоит из четырех четких этапов. На первом этапе обнаружения каждая камера обрабатывает свой видеопоток через детектор объектов. Платформа поддерживает три модели «из коробки»:
- PeopleNetTransformer: детектор людей на основе трансформеров, который является выбором по умолчанию для сцен с пешеходами. Он обеспечивает высокую точность в сложных условиях.
- PeopleNet v2.6.3: высокоэффективный детектор, основанный на архитектуре DetectNet_v2. Идеален для сценариев, где важна скорость обработки при сохранении приемлемой точности.
- RT-DETR 2D: многоклассовой детектор, который отлично справляется не только с людьми, но и с транспортом, погрузчиками и другими объектами, что критично для промышленных сред.

На втором этапе происходит однопредметная 3D-перцепция. Каждая камера использует матрицу проекции 3×4, хранящуюся в YAML-файле калибровки. Эта матрица позволяет «отбросить» 2D-ограничивающие рамки обратно в 3D-пространство мира, используя предположение о плоской земле (ground-plane assumption). Это позволяет определить не только где объект на экране, но и где он находится в реальном физическом пространстве.
Третий этап — многовидовая ассоциация. Трекер использует протокол MQTT (Message Queuing Telemetry Transport) для обмена данными между камерами. MQTT — это легкий протокол «издатель-подписчик», который идеально подходит для IoT и систем реального времени. Когда две камеры видят одного человека, система сопоставляет их треки (tracklets) на основе близости в 3D-пространстве мира. Если координаты совпадают с заданной точностью, это один и тот же объект.
На четвертом этапе результаты выводятся в трех форматах. On-Screen Display (OSD) показывает тайловую сетку с 2D и 3D рамками. Bird’s-Eye View (BEV) рендерит карту траекторий сверху вниз, что очень наглядно для аналитики потоков. И, наконец, Kafka-мессенджер доставляет метаданные в формате protobuf для каждого кадра, включая ID сенсора, ID объекта и 3D-координаты. Эти данные готовы для дальнейшей аналитики или отображения на дашбордах.
03AutoMagicCalib: Устранение ручных настроек
MV3DT требует, чтобы камеры были откалиброваны, то есть чтобы система знала точное положение и ориентацию каждой камеры относительно мира. Традиционно это делалось с помощью шахматных досок, что
Источник: MarkTechPost ↗
