В эпоху, когда данные становятся главным активом предприятия, видеоинформация часто остается «темной материей» — огромным массивом записей, которые трудно проанализировать вручную. Традиционные системы видеонаблюдения или архивы записей способны лишь фиксировать события, но не интерпретировать их в контексте бизнес-задач. Возникает критическая потребность в том, чтобы ИИ-агенты не просто «видели» видео, но и понимали его смысл, сопоставляли с внутренними документами компании и предпринимали конкретные действия. Именно этот переход от пассивного анализа к активному действию описывает новая архитектура, разработанная NVIDIA.
В этой статье мы подробно разберем, как интегрировать контекстно-зависимые видео-AI агенты в существующие корпоративные рабочие процессы. Мы рассмотрим связку из NVIDIA Metropolis (для видеоаналитики), RAG-системы (для работы с корпоративными знаниями) и NVIDIA NemoClaw (для оркестрации автономных агентов). Вы узнаете, как создать систему, которая способна не только ответить на вопрос «Что показывает видео?», но и сформулировать «Что нам с этим делать?» и автоматически передать задачу в тикет-систему или базу знаний. Это руководство предназначено для разработчиков, архитекторов ИИ-решений и технических лидеров, стремящихся масштабировать agentic AI в своих организациях.
01Почему видеоаналитика требует нового подхода к интеграции
Проблема изолированности данных в корпоративной среде знакома многим. Системы видеонаблюдения, базы знаний, платформы для обмена сообщениями и очереди задач (такие как Jira или ServiceNow) часто существуют в отдельных «силосах». Разработчикам приходится решать сложную задачу: как извлечь намерение пользователя, получить правильный контекст из организационных документов, сгенерировать структурированный отчет и маршрутизировать результаты в downstream-системы.
Ранее мы обсуждали, как обогащать анализ видео знаниями с помощью NVIDIA Blueprints. Однако этот шаг был лишь частью пути. Настоящая ценность раскрывается, когда система может программно действовать на основе анализа. Для этого мы вводим NVIDIA NemoClaw — коллекцию открытых blueprint’ов для создания автономных агентов. NemoClaw позволяет строить доменно-специализированных агентов, которые работают в режиме 24/7, безопасны, быстры и экономически эффективны.
Ключевые компоненты этой экосистемы:
- NVIDIA Blueprints: Настраиваемые эталонные рабочие процессы для построения agentic AI-конвейеров масштаба предприятия. Они сочетают специализированные микросервисы, оптимизированные модели и композиционные API.
- NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS): Система, которая принимает потоковое или архивное видео, генерирует субтитры и визуальные метаданные, поддерживает семантический поиск, интерактивный Q&A и суммаризацию событий.
- NVIDIA AI Blueprint for Retrieval-Augmented Generation (RAG): Индексирует проприетарные документы компании (руководства, политики, регламенты, SOP) в GPU-ускоренное векторное хранилище для быстрого семантического поиска.
02Архитектура агента: как VSS захватывает намерение и генерирует отчеты
Сердцем новой системы является агент VSS, который использует набор инструментов для проведения контекстно-зависимого анализа. Ключевой особенностью является использование Human-in-the-loop (HITL) — взаимодействия с человеком — на этапе сбора намерений. Это позволяет пользователю четко определить, что именно нужно проанализировать, до начала ресурсоемкой обработки видео.
Три основных инструмента агента работают в тандеме:
- Long Video Summary (LVS): Инструмент понимания видео. Он выполняет суммаризацию длинных видео, но делает это только после обязательного сбора параметров через HITL. Пользователь интерактивно указывает сценарий (о чем видео), события интереса (что обнаруживать), объекты фокуса (что отслеживать) и, опционально, запрос для извлечения знаний.
- Knowledge Retrieval (frag): Этот инструмент вызывает RAG Blueprint для получения контекста, специфичного для организации. Он извлекает информацию из документов, политик и баз знаний. RAG Blueprint берет на себя внутреннюю работу: эмбеддинг, переупорядочивание (reranking) и векторный поиск.
- Report Generation: Инструмент формирования отчета. Он объединяет анализ видео с полученным контекстом, создавая структурированный, помеченный временными метками отчет. В отчет входят временные метки событий, нарративный анализ, основанный на справочных материалах, цитаты из источников и конкретные рекомендуемые действия. Пользователь может подтвердить или отредактировать промпт перед генерацией финального отчета.
Вместе эти инструменты собирают намерение пользователя, запрашивают контекстные знания, обрабатывают видео с учетом этого контекста и передают результат в инструмент генерации отчетов. Это превращает видео из простого файла в источник структурированных бизнес-инсайтов.

03Пример использования: «Коуч здорового питания»
Чтобы проиллюстрировать этот процесс, давайте рассмотрим практический пример. Мы создадим агента-«коуча здорового питания», который анализирует видео приготовления еды, оценивает привычки пользователя и возвращает конкретные, отслеживаемые шаги для улучшения рациона. Этот пример демонстрирует, как абстрактная технология применяется к конкретной бизнес-задаче.
Шаг 1: Загрузка видео и спецификация анализа
Пользователь загружает видео приготовления блюда через интерфейс VSS. NemoClaw начинает рабочий процесс, читая определение навыка vss-generate-video-report-rag (файл SKILL.md). Он определяет, какие параметры необходимы для анализа, и передает запрос агенту VSS. Агент, в свою очередь, инициирует серию HITL-промптов в терминале пользователя.

Промпты задают вопросы: что именно анализировать, какой сценарий рассматривать, какие события важны, какие объекты отслеживать. Также запрашивается опциональный запрос к RAG Blueprint, например, для получения нормативов по питанию или регуляторных требований. Такой подход позволяет «узко настроить» анализ именно на то, что волнует пользователя, до начала вычислений. Для автоматизированных пакетных запусков эти ответы могут подаваться программно, без интерактивного взаимодействия.
Шаг 2: Оркестрация VSS и RAG Blueprint через NemoClaw
После подтверждения параметров NemoClaw оркестрирует конвейер. Инструмент LVS сначала запрашивает у RAG Blueprint соответствующие диетические рекомендации. RAG Blueprint возвращает совпадающие справочные документы, выполняя векторный поиск внутри себя. Затем эти параметры, само видео и полученный контекст передаются в сервис LVS. LVS иерархически суммаризирует видео и вплетает справочные знания в свои выводы.
Инструмент генерации отчетов объединяет результат в структурированный отчет с временными метками. В нем содержатся обнаруженные события с таймкодами, нарративный анализ, основанный на справочных материалах, цитаты из источников и конкретные рекомендуемые действия. На терминале NemoClaw видно, как агент рассуждает и вызывает инструменты.

Шаг 3: Создание тикета в Jira
Самый важный этап — переход от анализа к действию. NemoClaw читает готовый отчет и превращает его в скоординированное действие. Он представляет пользователю полный анализ со ссылками на Markdown/PDF отчеты и видео, краткое резюме того, почему блюдо считается здоровым, и рекомендуемые следующие шаги.
Затем система автоматически создает тикет в Jira. Тикет суммирует выводы и рекомендуемые диетические корректировки, назначает приоритет и ответственного, чтобы действия были отслежены до завершения. Это демонстрирует, как отчет перестает быть статичным документом и становится триггером для скоординированных действий в системах, которые уже использует команда.


04Генерализация действий: за пределами Jira
Хотя пример с Jira нагляден, эта логика универсальна. В зависимости от содержания отчета, NemoClaw может:
- Создавать тикеты для выявленных проблем с правильным приоритетом и назначением.
- Эскалировать или суммировать паттерны, возникающие при множественных запусках анализа.
- Собирать подтверждающие доказательства для проверки или соответствия требованиям (compliance).
- Направлять пробелы в соответствующие рабочие процессы для последующих действий.
Таким образом, система обеспечивает полный цикл: DETECT (Обнаружение) → REASON (Рассуждение) → ACT (Действие). Это позволяет масштабировать реакцию на события, выявленные в видео, от ручного мониторинга до полностью автоматизированных бизнес-процессов.
05Архитектура решения: четыре уровня
Архитектура VSS 3.1 и RAG Blueprint, оркестрируемая NemoClaw, состоит из четырех основных слоев:
- Оркестрация: Агент NemoClaw, навык
vss-generate-video-report-ragи промпты HITL. Это «мозг», управляющий потоком данных. - Агент VSS: Включает инструменты ввода/вывода видео, поиска, понимания, LVS, извлечения знаний и генерации отчетов. Важно отметить, что извлечение знаний является частью агента, а не отдельным расширением.
- RAG Blueprint: Включает NVIDIA RAG API, векторную базу данных Milvus, NVIDIA Nemotron reranking NIM и проиндексированные справочные и организационные документы.
- LLM Fusion: Обогащение суммаризации, предоставленной VSS, контекстом, извлеченным через RAG Blueprint.
Данные текут вниз по системе: инструменты агента оркестрируют вызовы к сервису LVS и RAG Blueprint, которые, в свою очередь, питают инструмент генерации отчетов для финального вывода. Такая модульность позволяет заменять или обновлять компоненты (например, базу данных или модель LLM) без перестройки всей системы.
06Пошаговая инструкция по развертыванию
Ниже приведены шаги для реализации решения в вашей среде. Для работы потребуется GPU NVIDIA с минимум 24 ГБ VRAM, Docker Engine, Docker Compose v2, ключи NGC и NVIDIA Build API, а также развернутый RAG Blueprint.
Шаг 1: Клонирование репозитория VSS и аутентификация
git clone https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization.git ~/vss-public
cd ~/vss-public
echo "$NGC_CLI_API_KEY" | docker login nvcr.io --username '$oauthtoken' --password-stdinШаг 2: Настройка окружения
Отредактируйте файл профиля LVS .env в директории deploy/docker/developer-profiles/dev-profile-lvs/.env. Большинство переменных уже существуют, но вам нужно добавить параметры RAG_, которые агент использует для конфигурации RAG.
# Deployment selection
MODE=2d
BP_PROFILE=bp_developer_lvs
HARDWARE_PROFILE=H100 # H100, L40S, RTXPRO4500BW, RTXPRO6000BW, DGX-SPARK, IGX-THOR, AGX-THOR, or OTHER
# LLM / VLM placement
LLM_MODE=local_shared # local_shared runs LLM and VLM on one GPU; use 'local' for separate GPUs
VLM_MODE=local_shared
LLM_DEVICE_ID='0'
VLM_DEVICE_ID='0'
# Paths (you MUST set these)
VSS_APPS_DIR="/vss-public/deploy/docker"
VSS_DATA_DIR="/vss-apps-data"
HOST_IP=''
# Agent image + config
VSS_AGENT_VERSION=3.2.0
# Enable knowledge retrieval (frag): point at config_rag.yml (default config.yml has it off)
VSS_AGENT_CONFIG_FILE=./deploy/docker/developer-profiles/dev-profile-lvs/vss-agent/configs/config_rag.yml
# Credentials
NGC_CLI_API_KEY='nvapi-...'
NVIDIA_API_KEY='nvapi-...'
# RAG Blueprint connection (read by config_rag.yml)
RAG_SERVER_URL='http://:8081/v1'
RAG_API_KEY=''
KNOWLEDGE_COLLECTION='' Установка VSS_AGENT_CONFIG_FILE в config_rag.yml включает инструмент извлечения знаний. Три значения RAG_ — это единственные настройки RAG, которые нужны агенту: он вызывает конечную точку поиска сервера RAG, а RAG Blueprint обрабатывает эмбеддинг, переупорядочивание и векторный поиск внутренне. Настройте базу данных векторов, эмбеддинг и реранкер на самом развертывании RAG Blueprint, следуя его документации.
Шаг 3: Развертывание стека VSS
Создайте директории данных, необходимые для bind-монтирования, и запустите стек. Профиль compose выбирается автоматически из COMPOSE_PROFILES в файле .env.
export VSS_DATA_DIR=/vss-apps-data
mkdir -p "$VSS_DATA_DIR"/data_log/{elastic/data,elastic/logs,kafka,redis/data,redis/log}
chmod -R 777 "$VSS_DATA_DIR/data_log"
cd ~/vss-public/deploy/docker
docker compose \
--env-file developer-profiles/dev-profile-lvs/.env \
-f compose.yml \
up -d Стек compose запускает всю инфраструктуру (VST, Redis, Elasticsearch, LVS, NIM) и агент, используя конфигурацию с поддержкой RAG. Вы также можете использовать помощник dev-profile для автоматического создания директорий данных.
Шаг 4: Проверка здоровья сервисов
Обратите внимание, что загрузка NIM может занять от 5 до 15 минут. Проверьте статус сервисов:
docker ps --format 'table {{.Names}}\t{{.Status}}\t{{.Ports}}'
curl -sS http://localhost:8000/health
# VSS agent
curl -f http://127.0.0.1:38111/v1/ready
# LVS backend
curl -f http://127.0.0.1:8018/v1/health/ready
# RT-VLM
curl -f http://127.0.0.1:30081/v1/health/readyНастройка NemoClaw
NemoClaw действует как слой оркестрации, настраивая песочницу, сетевые политики и навыки.
Шаг 1: Запуск установщика NemoClaw
Из корня репозитория:
NEMOCLAW_PROVIDER=build \
NVIDIA_API_KEY="$NVIDIA_API_KEY" \
bash deploy/docker/scripts/nemoclaw/init_nemoclaw.sh demoЭта команда выполняет полную настройку: регистрирует NemoClaw, настраивает провайдера моделей, применяет политику песочницы VSS (предоставляющую доступ к агенту VSS на порту 8000), устанавливает навыки репозитория (включая vss-generate-video-report-rag) в песочницу как плагин OpenClaw и выводит URL интерфейса OpenClaw.
Шаг 2: Тестирование сквозного рабочего процесса
nemoclaw SANDBOX_NAME connect
openclaw tuiИнтерфейс OpenClaw теперь открыт. Внутри UI выполните следующие действия:
- Введите
/newи нажмите Enter, чтобы начать новую сессию. - Введите ваш запрос:
I want to generate a video summary report for <VIDEO_NAME>
Агент соберет параметры анализа через промпты HITL, сгенерирует отчет с помощью LVS и RAG Blueprint и, при необходимости, создаст тикет в Jira или отправит уведомления.
07Практическое применение в промышленности
Комбинация понимания видео, извлечения знаний и агентной оркестрации открывает новые возможности для различных отраслей. Партнеры NVIDIA уже демонстрируют эффективность этого подхода.
Computacenter развернул полный конвейер DETECT → REASON → ACT на кластере Run:AI для предиктивного обслуживания. Они используют VSS 3 для анализа дронных, бороскопических и тепловых инспекционных кадров, RAG Blueprint для контекста от производителя оборудования (OEM) и NemoClaw для автоматического черновика рабочих заказов в Maximo. Это сократило время от кадра до рабочего заказа с 30–45 минут до примерно 19 секунд для четырех классов активов.
VAST Data использует NemoClaw для оркестрации решений, демонстрируя, как эта архитектура может быть адаптирована для работы с большими объемами неструктурированных данных и интеграции с существующей ИТ-инфраструктурой предприятия.
08Что это значит на практике
Интеграция контекстно-зависимых видео-AI агентов в корпоративные рабочие процессы — это не просто техническое улучшение, а стратегический сдвиг в том, как организации используют визуальные данные. Переход от вопроса «Что показывает видео?» к вопросу «Что нам с этим делать?» позволяет автоматизировать рутинные процессы, снизить время реакции на инциденты и обеспечить соблюдение нормативных требований.
Для разработчиков это означает возможность создавать модульные, масштабируемые решения, которые легко интегрируются с существующими инструментами, такими как Jira, ServiceNow или корпоративные базы знаний. Для бизнеса это означает сокращение операционных расходов, повышение точности анализа и возможность принимать решения на основе данных в реальном времени.
Использование NVIDIA NemoClaw, VSS и RAG Blueprint предоставляет готовый фундамент для построения таких систем. Следующий шаг — адаптация этих blueprint’ов под специфические потребности вашей отрасли, будь то здравоохранение, производство, логистика или ритейл. Начните с пилотного проекта, такого как «коуч здорового питания» или инспекция оборудования, и масштабируйте решение по мере подтверждения его ценности.
Эта архитектура открывает путь к созданию по-настоящему интеллектуальных систем, которые не только наблюдают, но и понимают, рассуждают и действуют, становясь неотъемлемой частью эффективных корпоративных процессов.
Источник: NVIDIA Developer ↗
