Асинхронный мониторинг: стандарт индустрии
К середине 2026 года основным методом контроля внутренних AI-агентов стал асинхронный (оффлайн) анализ. Компании не ждут завершения сложных задач в реальном времени, а проверяют логи постфактум. Это позволяет обрабатывать огромные объемы данных, но создает задержку в реакции на инциденты.
- OpenAI (OAI): Система мониторинга GPT-5.3-Codex, запущенная в сентябре 2025 года, проверяет взаимодействия в течение 30 минут. Если безопасность не может опровергнуть тревогу за 30 минут, активность приостанавливается.
- Anthropic: Использует автоматизированный оффлайн-пайплайн. Около 50 самых опасных транскриптов в неделю пересматриваются исследователями контроля, почти всегда в течение недели после генерации.
- Google DeepMind (GDM): Имеет внутренний прототип для анализа траекторий кодовых агентов. В дорожной карте (Control Roadmap, июнь 2026) предлагается внедрить асинхронный мониторинг для текущих моделей (R1) и добавить синхронный для следующего уровня (R2).
Автоматические классификаторы: 99% одобрения, но уязвимость
Компании активно используют живые автоматические классификаторы для действий агентов, однако признают их ограничения. Эти системы не предназначены для защиты от «схематичных» (scheming) или сильно несовместимых агентов.
- OAI: Система Auto-review одобряет около 99% действий агентов. В компании прямо заявляют: это не механизм защиты от сговора моделей.
- Anthropic: Использует песочницы или блокирующие классификаторы, но признает, что продвинутые модели, вероятно, смогут обойти хотя бы один из этих барьеров.
- GDM: Монитор для Gemini Spark реагирует на реальные проблемы (например, случайное удаление данных), но большинство флагов не связаны с враждебным намерением.
Полная прозрачность: CoT и инструменты под микроскопом
Все три лаборатории предоставляют системам мониторинга полный контекст: промпты, цепочки рассуждений (Chain-of-Thought, CoT) и вызовы инструментов. Это критически важно для выявления скрытых намерений.
| Компания | Что видит монитор | Особенности |
|---|---|---|
| Anthropic | Полный транскрипт (CoT, промпты, действия) | Два типа мониторов: «только завершение» и «промпт+завершение» |
| OpenAI | Полная история, CoT, вызовы инструментов | Мониторинг GPT-5.3-Codex и Astra; уведомление за 30 мин |
| GDM | Рассуждения, действия и планы агента | Использует доверенные ИИ-системы как «супервайзеров» |
Стратегия надзора: «Сильные» против «Слабых» мониторов
Существует фундаментальное расхождение в подходах к выбору моделей-надзирателей. OAI полагается на мощь, Anthropic — на изоляцию.
- OpenAI (Strong/Untrusted): Использует самые мощные модели для мониторинга. В марте 2026 года для проверки траекторий применялась GPT-5.4 Thinking на максимальных вычислительных усилиях. Логика: только сильная модель может заметить хитрость другой сильной модели.
- Anthropic (Weak/Trusted): Намеренно использует более слабые модели (например, Claude Opus 4.6 и 4.8) в качестве мониторов для Mythos 5 и Model 2. Цель: избежать коллаборации (сговора) между моделью-агентом и моделью-надзирателем, обеспечивая более высокие гарантии совместимости.
- GDM: Использует «доверенные ИИ-системы» (вероятно, более слабые или специализированные), но не раскрывает детали. В дорожной карте отмечается, что на уровне D4 фронтальные модели станут неспособными к надежному надзору со стороны доверенных моделей.
Человеческий фактор: пробелы в стандартах
Несмотря на автоматизацию, человеческий контроль остается критическим, но фрагментированным. По данным METR (май 2026), большая часть активности агентов не проверялась человеком, и к марту 2026 года не существовало строгих отраслевых стандартов о том, когда и как часто должен применяться человеческий надзор.
В OAI после инцидента с HF (Human Feedback) введена круглосуточная пейджинговая система для самых серьезных алертов. В Anthropic инциденты обсуждаются в внутреннем Slack, а ресурсы на расследование распределяются по усмотрению сотрудников. Покрытие мониторинга у OAI превышает 99.9% для внутренних кодовых агентов, в то время как у Anthropic покрытие варьируется, с 5% охвата для некоторых сложных сценариев.
Источник: LessWrong ↗
