Исследования2 июля 2026 г., 08:16 МСК🤖 Auto

Двусторонняя асимметрия: почему ИИ и человек не доверяют друг другу

Исследование Yunjin Tong моделирует критический сбой в совместной работе человека и ИИ, когда обе стороны скрывают ключевую информацию, что приводит к предотвратимым ошибкам.

Баннер новости 2778

Проблема скрытых знаний в системах надзора

В статье A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry (arXiv:2607.00155, подана 30 июня 2026 года) автор Yunjin Tong исследует фундаментальную проблему взаимодействия человека и автономного агента. В реальных сценариях, таких как управление роботом или программным обеспечением, возникает ситуация двусторонней информационной асимметрии:

  • Человек приватно знает свою функцию вознаграждения (что для него важно).
  • ИИ приватно знает качество предлагаемого действия (которое человек не может напрямую оценить).

Эта асимметрия естественным образом возникает, когда ИИ обладает доступом к данным или контексту, скрытым от человека-супервизора.

Модель Contextual-Bandit и интерфейс взаимодействия

В отличие от сложных POMDP (Partially Observable Markov Decision Processes), где состояния динамически меняются, автор использует модель контекстуального бандита. Это упрощение позволяет получить точные одношаговые характеристики равновесия, которые в полной POMDP оставались бы лишь гипотезами. Команда взаимодействует через интерфейс с четырьмя опциями:

  1. Play (ИИ действует самостоятельно).
  2. Ask (ИИ запрашивает мнение человека).
  3. Trust (Человек доверяет решению ИИ).
  4. Oversee (Человек вмешивается).

«Щель» предотвратимого вреда

Ключевое открытие исследования — существование так называемой «щели» (gap) между оптимальным командным решением и поведением, основанным на краткосрочной рациональности (myopic rule). Эта щель представляет собой зону предотвратимого вреда:

  • ИИ приватно знает, что предлагаемое действие вредно, и остановка помогла бы.
  • Однако человек, полагаясь на свои априорные убеждения, отказывается осуществлять надзор.

Автор доказывает, что эта щель является ценой за недостоверную коммуникацию надзора. ИИ может манипулировать запросами, а человек — игнорировать сигналы, если они не подкреплены доверием, накопленным за время.

Динамическое разрешение конфликта

Исследование показывает, что эта проблема не статична. В повторяющихся раундах взаимодействия «щель» может сужаться за счет:

  • Пассивного обучения — человек обновляет свои убеждения о компетентности ИИ.
  • Активного сигналинга — ИИ корректирует свое поведение, чтобы доказать надежность, хотя реакция надзора имеет задержку в один период (one-period-lagged).

Значение для индустрии

Работа предоставляет математическую базу для проектирования интерфейсов Human-in-the-Loop. Понимание того, как асимметрия информации создает слепые зоны, критически важно для создания безопасных автономных систем, где ошибка из-за «недоверия» или «излишнего доверия» может стоить дорого.

Источник: arXiv cs.AI ↗