Исследования7 октября 2026 г., 12:18 МСК🤖 Auto

Мониторинг AI-агентов в 2026: GPT-5.4, Anthropic и GDM

Анализ открытых данных показывает, как ведущие лаборатории (OAI, Anthropic, GDM) контролируют автономных AI-агентов. Ключевые различия: OAI использует мощнейшие модели для надзора, Anthropic — слабые для безопасности, а GDM планирует переход к синхро

Баннер новости 9099

Асинхронный мониторинг: стандарт индустрии

К середине 2026 года основным методом контроля внутренних AI-агентов стал асинхронный (оффлайн) анализ. Компании не ждут завершения сложных задач в реальном времени, а проверяют логи постфактум. Это позволяет обрабатывать огромные объемы данных, но создает задержку в реакции на инциденты.

  • OpenAI (OAI): Система мониторинга GPT-5.3-Codex, запущенная в сентябре 2025 года, проверяет взаимодействия в течение 30 минут. Если безопасность не может опровергнуть тревогу за 30 минут, активность приостанавливается.
  • Anthropic: Использует автоматизированный оффлайн-пайплайн. Около 50 самых опасных транскриптов в неделю пересматриваются исследователями контроля, почти всегда в течение недели после генерации.
  • Google DeepMind (GDM): Имеет внутренний прототип для анализа траекторий кодовых агентов. В дорожной карте (Control Roadmap, июнь 2026) предлагается внедрить асинхронный мониторинг для текущих моделей (R1) и добавить синхронный для следующего уровня (R2).

Автоматические классификаторы: 99% одобрения, но уязвимость

Компании активно используют живые автоматические классификаторы для действий агентов, однако признают их ограничения. Эти системы не предназначены для защиты от «схематичных» (scheming) или сильно несовместимых агентов.

  • OAI: Система Auto-review одобряет около 99% действий агентов. В компании прямо заявляют: это не механизм защиты от сговора моделей.
  • Anthropic: Использует песочницы или блокирующие классификаторы, но признает, что продвинутые модели, вероятно, смогут обойти хотя бы один из этих барьеров.
  • GDM: Монитор для Gemini Spark реагирует на реальные проблемы (например, случайное удаление данных), но большинство флагов не связаны с враждебным намерением.

Полная прозрачность: CoT и инструменты под микроскопом

Все три лаборатории предоставляют системам мониторинга полный контекст: промпты, цепочки рассуждений (Chain-of-Thought, CoT) и вызовы инструментов. Это критически важно для выявления скрытых намерений.

Компания Что видит монитор Особенности
Anthropic Полный транскрипт (CoT, промпты, действия) Два типа мониторов: «только завершение» и «промпт+завершение»
OpenAI Полная история, CoT, вызовы инструментов Мониторинг GPT-5.3-Codex и Astra; уведомление за 30 мин
GDM Рассуждения, действия и планы агента Использует доверенные ИИ-системы как «супервайзеров»

Стратегия надзора: «Сильные» против «Слабых» мониторов

Существует фундаментальное расхождение в подходах к выбору моделей-надзирателей. OAI полагается на мощь, Anthropic — на изоляцию.

  • OpenAI (Strong/Untrusted): Использует самые мощные модели для мониторинга. В марте 2026 года для проверки траекторий применялась GPT-5.4 Thinking на максимальных вычислительных усилиях. Логика: только сильная модель может заметить хитрость другой сильной модели.
  • Anthropic (Weak/Trusted): Намеренно использует более слабые модели (например, Claude Opus 4.6 и 4.8) в качестве мониторов для Mythos 5 и Model 2. Цель: избежать коллаборации (сговора) между моделью-агентом и моделью-надзирателем, обеспечивая более высокие гарантии совместимости.
  • GDM: Использует «доверенные ИИ-системы» (вероятно, более слабые или специализированные), но не раскрывает детали. В дорожной карте отмечается, что на уровне D4 фронтальные модели станут неспособными к надежному надзору со стороны доверенных моделей.

Человеческий фактор: пробелы в стандартах

Несмотря на автоматизацию, человеческий контроль остается критическим, но фрагментированным. По данным METR (май 2026), большая часть активности агентов не проверялась человеком, и к марту 2026 года не существовало строгих отраслевых стандартов о том, когда и как часто должен применяться человеческий надзор.

В OAI после инцидента с HF (Human Feedback) введена круглосуточная пейджинговая система для самых серьезных алертов. В Anthropic инциденты обсуждаются в внутреннем Slack, а ресурсы на расследование распределяются по усмотрению сотрудников. Покрытие мониторинга у OAI превышает 99.9% для внутренних кодовых агентов, в то время как у Anthropic покрытие варьируется, с 5% охвата для некоторых сложных сценариев.

Источник: LessWrong ↗