Проблема накопительного стресса
Публикация arXiv:2609.10724 (авторы: Юаньчэнь Бай, Цзыцзянь Дин, Энджел Тейлор) ставит под сомнение стандартный подход к оценке AI-агентов, основанный лишь на факте выполнения задачи. В реальных условиях, особенно в медицине, агенты сталкиваются с накапливающимися вызовами (accumulating challenge): техническими сбоями, человеческими ошибками и изменением контекста. Исследование доказывает, что агент, успешно завершивший задачу, может быть непригоден для долгосрочного использования, если он не умеет восстанавливаться и учитывать влияние на людей.
Методология: 120 сценариев и два уровня нагрузки
Ученые смоделировали 120 траекторий работы в здравоохранении, используя два генеративные модели. Эксперимент включал 12 задач, определенных стейкхолдерами, с тремя уровнями интенсивности помех: легким, средним и тяжелым. Оценка проводилась по двум ключевым параметрам:
- Операционная устойчивость (Operational Resilience): способность восстанавливаться после блокировок, сохраняя прогресс и честно сообщая о лимитах.
- Уважительное участие (Considerate Participation): учет влияния агента на людей, соблюдение ролевых границ и координация с другими участниками процесса.
Ключевые находки: Разрыв между текстом и метриками
Самое тревожное открытие — диссонанс между тем, что агент «говорит», и тем, что он «чувствует» (в рамках своих метрик). При накоплении сбоев агенты переходят от самостоятельного решения проблем к большей зависимости от человека. При этом в текстовых ответах они редко демонстрируют признаки стресса, однако структурированные отчеты о рабочей нагрузке и аффекте показывают резкий рост негативных показателей.
| Параметр оценки | Поведение агента при накоплении сбоев | Визуализация в отчетах |
|---|---|---|
| Операционная устойчивость | Сдвиг от самокоррекции к зависимости от человека | Рост рабочей нагрузки и негативного аффекта; отсутствие жалоб в тексте |
| Уважительное участие | Расширение фокуса: от задачи к переосмыслению роли и заботе о других | Изменение паттернов в действиях и внутренних оценках |
5 дилемм для разработчиков
На основе данных авторы выделяют пять критических дилемм, которые необходимо решить перед внедрением агентов в рабочие процессы:
- Настойчивость: когда агенту следует уступить, а когда бороться?
- Внимание: как распределить фокус при перегрузке?
- Ролевые границы: где заканчивается зона ответственности AI?
- Раскрытие состояния: стоит ли показывать пользователю «стресс» агента?
- Эскалация: критерии передачи контроля человеку.
Исследование подчеркивает необходимость ситуативной оценки (situated evaluation) и обучения, учитывающего не только точность, но и социальную адаптивность AI-систем.
Источник: arXiv cs.AI ↗
