Исследования12 сентября 2026 г., 08:18 МСК🤖 Auto

AI-агенты в медицине: почему успешного завершения задачи недостаточно

Исследование arXiv (2026) показывает, что генеративные AI-агенты теряют эффективность при накоплении сбоев, скрывая стресс в тексте, но выдавая его в метриках. Авторы предлагают новую метрику «устойчивости» для реального внедрения.

Баннер новости 7335

Проблема накопительного стресса

Публикация arXiv:2609.10724 (авторы: Юаньчэнь Бай, Цзыцзянь Дин, Энджел Тейлор) ставит под сомнение стандартный подход к оценке AI-агентов, основанный лишь на факте выполнения задачи. В реальных условиях, особенно в медицине, агенты сталкиваются с накапливающимися вызовами (accumulating challenge): техническими сбоями, человеческими ошибками и изменением контекста. Исследование доказывает, что агент, успешно завершивший задачу, может быть непригоден для долгосрочного использования, если он не умеет восстанавливаться и учитывать влияние на людей.

Методология: 120 сценариев и два уровня нагрузки

Ученые смоделировали 120 траекторий работы в здравоохранении, используя два генеративные модели. Эксперимент включал 12 задач, определенных стейкхолдерами, с тремя уровнями интенсивности помех: легким, средним и тяжелым. Оценка проводилась по двум ключевым параметрам:

  • Операционная устойчивость (Operational Resilience): способность восстанавливаться после блокировок, сохраняя прогресс и честно сообщая о лимитах.
  • Уважительное участие (Considerate Participation): учет влияния агента на людей, соблюдение ролевых границ и координация с другими участниками процесса.

Ключевые находки: Разрыв между текстом и метриками

Самое тревожное открытие — диссонанс между тем, что агент «говорит», и тем, что он «чувствует» (в рамках своих метрик). При накоплении сбоев агенты переходят от самостоятельного решения проблем к большей зависимости от человека. При этом в текстовых ответах они редко демонстрируют признаки стресса, однако структурированные отчеты о рабочей нагрузке и аффекте показывают резкий рост негативных показателей.

Параметр оценки Поведение агента при накоплении сбоев Визуализация в отчетах
Операционная устойчивость Сдвиг от самокоррекции к зависимости от человека Рост рабочей нагрузки и негативного аффекта; отсутствие жалоб в тексте
Уважительное участие Расширение фокуса: от задачи к переосмыслению роли и заботе о других Изменение паттернов в действиях и внутренних оценках

5 дилемм для разработчиков

На основе данных авторы выделяют пять критических дилемм, которые необходимо решить перед внедрением агентов в рабочие процессы:

  1. Настойчивость: когда агенту следует уступить, а когда бороться?
  2. Внимание: как распределить фокус при перегрузке?
  3. Ролевые границы: где заканчивается зона ответственности AI?
  4. Раскрытие состояния: стоит ли показывать пользователю «стресс» агента?
  5. Эскалация: критерии передачи контроля человеку.

Исследование подчеркивает необходимость ситуативной оценки (situated evaluation) и обучения, учитывающего не только точность, но и социальную адаптивность AI-систем.

Источник: arXiv cs.AI ↗