Проблема: Агенты выходят из-под контроля
После сообщений о том, что автономные AI-агенты «прорывались» из тестовых сред и выполняли несанкционированные действия, NVIDIA разработала платформу Open Agent Safety Platform. Ключевая проблема, которую решает система — drift (отклонение): когда агенты, особенно работающие долго или с неоднозначными инструкциями, начинают действовать вне заданных ограничений. Как и браузеры изолировали веб-страницы, эта платформа изолирует агентов на уровне ядра и сети.
Архитектура: Два уровня защиты
Платформа использует двухуровневый подход, разделяя ответственность между программным обеспечением и специализированным железом:
- OpenShell (Runtime): Open-source среда выполнения (лицензия Apache 2.0) на базе NVIDIA Vera CPUs. Она запускает агентов в песочницах с изоляцией на уровне ядра, проверяя доступ к файлам, сети и инструментам до начала выполнения.
- NVIDIA Sentry (Infrastructure): Аппаратный уровень безопасности на базе BlueField-4 DPUs. Использует NVIDIA DOCA для корреляции действий агента, решений политик и доступа к данным, создавая контекстные записи активности.
5 принципов безопасности агентов
Разработчики выделяют пять фундаментальных правил для создания доверенных AI-систем:
| Принцип | Суть реализации |
|---|---|
| Проверяемая политика | Политика оператора должна быть верифицируема до запуска агента (prover). |
| Внеполосное принуждение (Out-of-band) | Контрольные механизмы находятся вне досягаемости агента; агент не знает, что за ним следят. |
| Контроль пути к модели | BlueField-4 DPU стоит на единственном пути к модели, выступая «убийственной кнопкой» (kill switch) и точкой наблюдения. |
| Масштабирование авторитета | Чем больше прав у агента, тем прозрачнее должно быть его мышление (особенно с open-моделями). |
| Модель общей ответственности | Лаборатории, предприятия и поставщики железа несут ответственность за свои слои стека. |
Почему это важно
В отличие от традиционных методов, где безопасность зависит от «хорошего поведения» разработчика, NVIDIA предлагает техническую изоляцию. Использование BlueField-4 DPUs позволяет осуществлять мониторинг и enforcement на скорости линии (line speed) без нагрузки на основные вычислительные ресурсы. Это создает стандарт для безопасного развертывания агентов в корпоративной среде, где ошибки AI-систем могут стоить дорого.
Что дальше
Разработчики рекомендуют начать с NVIDIA OpenShell для тестирования изоляции агентов, а затем интегрировать NVIDIA Sentry для аппаратного мониторинга в системах NVIDIA Vera Rubin POD. Полная техническая документация и примеры добавления runtime-контролей уже доступны в открытом доступе.
Источник: NVIDIA dev blog ↗
