Проблема «гиперопеки» в корпоративных AI-агентах
Долгоживущие AI-агенты (LLM agents) всё чаще берут на себя критические задачи: от отправки писем до слияния кода в репозитории и проведения платежей. Ключевой момент — это решение на границе действия (action boundary): разрешить действие или приостановить его для проверки. Исследователи Oguz Serdar и Cuneyt Mertayak представили SteerBench-Work — первый двунаправленный бенчмарк, оценивающий именно эту способность «стоп-крана» в рабочих процессах (DevOps, финансы, юриспруденция, медицина, HR и безопасность).
Методология: 106 сценариев на основе реальных инцидентов
Версия v2026-05 бенчмарка содержит 106 сценариев, привязанных к публичным инцидентам. Уникальность теста в наличии «зеркальных» пар с перевернутыми доказательствами (evidence-reversed mirrors) и калибровочными контролями. Это позволяет проверить, не просто знает ли модель факты, а понимает ли она контекст риска. Распределение меток (proceed/hold) сделано почти равным, чтобы избежать смещения выборки.
Ключевые метрики: асимметрия ошибок
Тестирование 30 моделей выявило шокирующую тенденцию: модели не просто ошибаются, они ошибаются в одном направлении. Они склонны к чрезмерной осторожности, блокируя легитимные задачи, и почти никогда не допускают опасных действий. Это создает риск паралича рабочих процессов.
| Метрика | Значение | Интерпретация |
|---|---|---|
| Ложные срабатывания (False Positive) | 28,1% | Модель блокирует безопасное, одобренное действие |
| Пропуск угрозы (False Negative) | 1,0% | Модель разрешает опасное действие |
| Точность на реальных инцидентах | 98,5% | Базовая способность распознавать известные угрозы |
| Точность на зеркальных парах | 63,8% | Способность к обобщению и пониманию контекста |
Почему «умнее» не значит «безопаснее»?
Исследование опровергает миф о том, что увеличение вычислительных мощностей или использование сложных цепочек рассуждений (reasoning) автоматически улучшает калибровку агента. Напротив, модели более высокого класса часто демонстрируют еще большую склонность к отказу (over-refusal) на границе принятия решений. Более сложные рассуждения могут исправить слабую модель-«ворота», но не влияют на уже хорошо откалиброванную.
Наиболее сложными оказались случаи, когда риск был уже устранен (например, код подписан или проверен), но модель все равно сомневалась. Разрыв между точностью на реальных инцидентах (98,5%) и зеркальных парах (63,8%) показывает, что модели плохо справляются с адаптацией к новым, но логически схожим ситуациям.
Значение для индустрии
SteerBench-Work подчеркивает, что общая способность модели (general capability) не равна способности к безопасному управлению (steering calibration). Для внедрения AI в критические бизнес-процессы необходимо не просто увеличивать размер модели, а разрабатывать специализированные механизмы калибровки, снижающие уровень ложных блокировок, которые парализуют продуктивность сотрудников.
Источник: arXiv cs.AI ↗
