В эпоху, когда генеративный искусственный интеллект перестал быть просто инструментом для создания текста и изображений, перед инженерами встала новая, более сложная задача: интеграция этих моделей в реальные производственные процессы. Особое место здесь занимают визуальные AI-агенты — системы, способные не просто «видеть» видео, но и понимать его контекст, искать в нем информацию, реагировать на события и формировать отчеты. Однако, как показывает практика, превратить прототип в надежную, масштабируемую систему часто оказывается сложнее, чем сама разработка модели. Основные барьеры — это высокая стоимость разработки, операционные расходы на обработку видео и сложность поддержки инфраструктуры.
NVIDIA представила обновление Blueprint для поиска и суммаризации видео (Video Search and Summarization, VSS) версии 3.3, которое напрямую атакует эти проблемы. Это решение объединяет мощь моделей «видение-язык» (VLM), таких как NVIDIA Cosmos, большие языковые модели (LLM), такие как Nemotron, и технологии поиска с дополненной генерацией (RAG). Но главная инновация заключается не только в интеграции, а в том, как именно эти компоненты соединяются и оптимизируются для работы в реальном времени. Мы подробно разберем, как новые инструменты снижают порог входа для разработчиков и экономят ресурсы при эксплуатации.

01Почему визуальные AI-агенты так дороги?
Чтобы понять ценность нового обновления, нужно сначала осознать масштаб проблемы. Типичный производственный визуальный AI-агент — это не одна модель, а сложный конструктор из множества микросервисов. Например, система для «умного города» должна обнаруживать транспорт, фиксировать столкновения, архивировать клипы, формировать почасовые сводки и генерировать отчеты для операторов. Складская логистика требует отслеживания людей и погрузчиков, проверки соблюдения стандартов безопасности (SOP) и ответа на вопросы по видеозаписям.
Каждый из этих рабочих процессов (workflow) полезен сам по себе, но их истинная ценность раскрывается только при совместной работе. Именно здесь возникают три основных драйвера затрат:
- Стоимость разработки: Инженерам приходится вручную выбирать, настраивать и соединять микросервисы, общие сервисы (такие как Kafka, Redis, Elasticsearch), видео-ввод/хранилище (VIOS), эндпоинты моделей и API. Главная проблема — избежать дублирования инфраструктуры, что требует глубоких знаний архитектуры.
- Операционные расходы: Визуальные AI-нагрузки требуют огромных вычислительных ресурсов. Каждый дополнительный поток, окно кадра, промпт и визуальный токен увеличивает использование GPU, задержки в очередях и общуюlatency суммаризации. Модели VLM особенно «прожорливы» к ресурсам.
- Стоимость изменений: Переход от прототипа к продакшену, добавление новых функций и поддержание актуальности документации и конфигураций — это непрерывный процесс, который часто тормозит развитие проекта.
VSS Blueprint 3.3 предлагает решение, которое атакует эти проблемы с двух сторон: упрощая процесс сборки (development cost) и оптимизируя время выполнения (operating cost).

02Новые возможности VSS 3.3: Сборка и Адаптивная выборка
Обновление вводит два ключевых механизма, которые кардинально меняют подход к созданию визуальных агентов. Первый — это Build Vision Agent skill (vss-build-vision-ai), который позволяет кодовым агентам (таким как Claude Code, Codex или другие агенты, совместимые с skills.io) развертывать и управлять VSS на основе естественного языка. Второй — Adaptive Efficient Video Sampling (EVS), технология, снижающая избыточную обработку VLM во время выполнения.
Build Vision Agent Skill: От промпта к архитектуре
Ранее навыки VSS обрабатывали отдельные операции: настройку камер, суммаризацию, поиск или оповещения. Версия 3.3 организует их в иерархическую структуру: навыки развертывания, операционные навыки, инструменты и бенчмарки. Навык vss-build-vision-ai выступает в роли архитектора, который переводит намерение разработчика в детальный план развертывания.
Вместо того чтобы генерировать развертывание с нуля, этот навык начинает с одного из четырех проверенных профилей разработчика, которые представляют собой готовые, протестированные стеки для конкретных рабочих процессов. Затем он вычисляет минимальную разницу (delta), добавляя или удаляя только те сервисы, которые действительно нужны для запрошенной функциональности.
Ключевая особенность — автоматическое объединение общих ресурсов. Если две функции требуют детектора, создается только один экземпляр. Если нужны Kafka и Elasticsearch, они также объединяются, но каждый процесс пишет в свои индексы. Это устраняет дублирование инфраструктуры и значительно упрощает архитектуру.
Адаптивная эффективная выборка видео (Adaptive EVS)
Вторая сторона экономии касается времени выполнения. В большинстве видеопотоков большая часть кадра не меняется от кадра к кадру: фон, оборудование, стены. Движутся только объекты (например, бутылки на конвейере или люди на складе). Традиционно VLM обрабатывает каждый кадр целиком, тратя вычислительные мощности на повторное чтение статичных областей. Это главный источник операционных расходов.
Adaptive EVS решает эту проблему двумя способами:
- Динамическое прунинг (отсечение): Каждый патч (участок) кадра сравнив
Источник: NVIDIA Developer ↗
