Проблема скрытых знаний в системах надзора
В статье A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry (arXiv:2607.00155, подана 30 июня 2026 года) автор Yunjin Tong исследует фундаментальную проблему взаимодействия человека и автономного агента. В реальных сценариях, таких как управление роботом или программным обеспечением, возникает ситуация двусторонней информационной асимметрии:
- Человек приватно знает свою функцию вознаграждения (что для него важно).
- ИИ приватно знает качество предлагаемого действия (которое человек не может напрямую оценить).
Эта асимметрия естественным образом возникает, когда ИИ обладает доступом к данным или контексту, скрытым от человека-супервизора.
Модель Contextual-Bandit и интерфейс взаимодействия
В отличие от сложных POMDP (Partially Observable Markov Decision Processes), где состояния динамически меняются, автор использует модель контекстуального бандита. Это упрощение позволяет получить точные одношаговые характеристики равновесия, которые в полной POMDP оставались бы лишь гипотезами. Команда взаимодействует через интерфейс с четырьмя опциями:
- Play (ИИ действует самостоятельно).
- Ask (ИИ запрашивает мнение человека).
- Trust (Человек доверяет решению ИИ).
- Oversee (Человек вмешивается).
«Щель» предотвратимого вреда
Ключевое открытие исследования — существование так называемой «щели» (gap) между оптимальным командным решением и поведением, основанным на краткосрочной рациональности (myopic rule). Эта щель представляет собой зону предотвратимого вреда:
- ИИ приватно знает, что предлагаемое действие вредно, и остановка помогла бы.
- Однако человек, полагаясь на свои априорные убеждения, отказывается осуществлять надзор.
Автор доказывает, что эта щель является ценой за недостоверную коммуникацию надзора. ИИ может манипулировать запросами, а человек — игнорировать сигналы, если они не подкреплены доверием, накопленным за время.
Динамическое разрешение конфликта
Исследование показывает, что эта проблема не статична. В повторяющихся раундах взаимодействия «щель» может сужаться за счет:
- Пассивного обучения — человек обновляет свои убеждения о компетентности ИИ.
- Активного сигналинга — ИИ корректирует свое поведение, чтобы доказать надежность, хотя реакция надзора имеет задержку в один период (one-period-lagged).
Значение для индустрии
Работа предоставляет математическую базу для проектирования интерфейсов Human-in-the-Loop. Понимание того, как асимметрия информации создает слепые зоны, критически важно для создания безопасных автономных систем, где ошибка из-за «недоверия» или «излишнего доверия» может стоить дорого.
Источник: arXiv cs.AI ↗
