Исследования15 сентября 2026 г., 12:17 МСК🤖 Auto

Asclepius: AI-агент, решающий проблему «усталости» в длительных клинических сценариях

Исследователи представили Asclepius — адаптивную систему для клинических LLM-агентов, которая устраняет разрыв между диагностикой и лечением в длительных сессиях, повышая корректность критических действий на 25%.

Баннер новости 7525

Проблема длинных горизонтов в медицине

Большинство LLM-агентов тестируются на коротких, однократных задачах, но реальная клиническая практика требует работы в течение часов под давлением нехватки ресурсов. Авторы исследования, опубликованного в arXiv (2026), используют симулятор Clinical Environment Simulator (CES) для моделирования смены в отделении неотложной помощи. Они выявили, что текущие агенты часто ставят верный диагноз, но терпят неудачу в выполнении полных и своевременных критических действий. Это явление авторы называют «разрывом выполнения» (execution gap).

Три режима отказа

Исследователи идентифицировали три ключевые причины провалов в длительных сессиях, которые действуют как связанный узкий горлышко:

  • Drift instruction adherence: отклонение от первоначальных инструкций по мере истечения времени.
  • Treatment incompleteness: неполное выполнение протоколов лечения.
  • Severity-equity gap: неравенство в своевременности помощи пациентам с разной степенью тяжести состояния.

Архитектура Asclepius

Для решения этих проблем создана система Asclepius, включающая три компонента:

  1. Self-evolving harness: механизм, который переписывает «руководство по эксплуатации» агента между сменами на основе обратной связи на уровне трассировки (trace-level feedback).
  2. Externalized clinical skills library: внешняя библиотека клинических навыков для хранения знаний о режимах лечения высокого риска.
  3. Three isolated subagents: три изолированных подагента, которые распределяют принятие решений по очереди пациентов, предотвращая перегрузку одного модуля.

Результаты и метрики

На тестовых наборах, не участвовавших в эволюции harness, Asclepius демонстрирует статистически значимые улучшения по сравнению с сильным базовым агентом. Ниже приведены ключевые метрики эффективности:

Метрика Улучшение (отдельные батчи) Улучшение (полный набор из 10 батчей) Статистическая значимость
Корректность критических действий +22% +25% p = 0.024
Своевременность действий +13%
Точность диагностики Сохранена на уровне базовой модели Сохранена на уровне базовой модели

Результаты подтверждены пятью LLM-судьями из трех разных семейств моделей. Исследование подчеркивает, что значимые сокращения ошибок происходят только при совместном действии всех трех компонентов системы, что делает Asclepius первым шагом к созданию надежных агентов для долгосрочного клинического мониторинга.

Источник: arXiv cs.AI ↗