Релиз модели2 октября 2026 г., 15:17 МСК🤖 Auto

Microsoft выпустила Agent Hooks: новый стандарт безопасности AI-агентов

Microsoft опубликовала спецификацию Agent Hooks, призванную решить критическую проблему «открытых» защитных механизмов в автономных AI-агентах.

Баннер новости 8781

Проблема «Fail-Open» в AI-агентах

Автономные AI-агенты, способные принимать решения и выполнять действия без постоянного вмешательства человека, сталкиваются с серьезной проблемой безопасности. Большинство существующих систем защиты (guardrails) работают по принципу «fail-open» — в случае сбоя или неопределенности они разрешают действие, чтобы не прерывать работу агента. Это создает уязвимости, которые могут быть использованы злоумышленниками для обхода ограничений.

Решение: Agent Hooks

27 августа 2026 года Microsoft опубликовала спецификацию Agent Hooks. Это не просто библиотека кода, а контракт (contract) — набор стандартизированных интерфейсов, которые позволяют разработчикам внедрять защитные механизмы на разных этапах жизненного цикла агента. Ключевая особенность — возможность перехватывать и проверять действия агента до их выполнения, обеспечивая принцип «fail-safe».

Как это работает

Agent Hooks определяет точки входа (hooks) в различных компонентах агента:

  • Input Hooks: Проверка входящих запросов на наличие вредоносных инструкций или попыток джейлбрейка.
  • Tool Use Hooks: Контроль за вызовами внешних инструментов и API. Позволяет блокировать опасные операции (например, удаление файлов или отправку данных) до их выполнения.
  • Output Hooks: Фильтрация ответов агента перед их отправкой пользователю.

Почему это важно

До появления Agent Hooks каждый разработчик создавал собственные системы безопасности, которые часто были несовместимы друг с другом и не обеспечивали комплексной защиты. Стандартизация через контракт Microsoft позволяет:

  1. Создавать универсальные защитные модули, совместимые с разными фреймворками для AI-агентов.
  2. Обеспечивать предсказуемое поведение систем безопасности даже в сложных сценариях.
  3. Упростить аудит и тестирование безопасности AI-систем.

Сравнение подходов

Критерий Традиционные Guardrails Agent Hooks (Microsoft)
Принцип работы при сбое Fail-Open (разрешить действие) Fail-Safe (заблокировать действие)
Совместимость Зависит от реализации Стандартизированный контракт
Точки контроля Обычно только вход/выход Вход, использование инструментов, выход
Гибкость Низкая Высокая (плагины и модули)

Публикация Agent Hooks знаменует собой важный шаг к созданию более безопасной и надежной экосистемы автономных AI-агентов. Разработчикам рекомендуется ознакомиться со спецификацией для интеграции новых стандартов безопасности в свои проекты.

Источник: Towards AI pub ↗