Проблема длинных горизонтов в медицине
Большинство LLM-агентов тестируются на коротких, однократных задачах, но реальная клиническая практика требует работы в течение часов под давлением нехватки ресурсов. Авторы исследования, опубликованного в arXiv (2026), используют симулятор Clinical Environment Simulator (CES) для моделирования смены в отделении неотложной помощи. Они выявили, что текущие агенты часто ставят верный диагноз, но терпят неудачу в выполнении полных и своевременных критических действий. Это явление авторы называют «разрывом выполнения» (execution gap).
Три режима отказа
Исследователи идентифицировали три ключевые причины провалов в длительных сессиях, которые действуют как связанный узкий горлышко:
- Drift instruction adherence: отклонение от первоначальных инструкций по мере истечения времени.
- Treatment incompleteness: неполное выполнение протоколов лечения.
- Severity-equity gap: неравенство в своевременности помощи пациентам с разной степенью тяжести состояния.
Архитектура Asclepius
Для решения этих проблем создана система Asclepius, включающая три компонента:
- Self-evolving harness: механизм, который переписывает «руководство по эксплуатации» агента между сменами на основе обратной связи на уровне трассировки (trace-level feedback).
- Externalized clinical skills library: внешняя библиотека клинических навыков для хранения знаний о режимах лечения высокого риска.
- Three isolated subagents: три изолированных подагента, которые распределяют принятие решений по очереди пациентов, предотвращая перегрузку одного модуля.
Результаты и метрики
На тестовых наборах, не участвовавших в эволюции harness, Asclepius демонстрирует статистически значимые улучшения по сравнению с сильным базовым агентом. Ниже приведены ключевые метрики эффективности:
| Метрика | Улучшение (отдельные батчи) | Улучшение (полный набор из 10 батчей) | Статистическая значимость |
|---|---|---|---|
| Корректность критических действий | +22% | +25% | p = 0.024 |
| Своевременность действий | — | +13% | — |
| Точность диагностики | Сохранена на уровне базовой модели | Сохранена на уровне базовой модели | — |
Результаты подтверждены пятью LLM-судьями из трех разных семейств моделей. Исследование подчеркивает, что значимые сокращения ошибок происходят только при совместном действии всех трех компонентов системы, что делает Asclepius первым шагом к созданию надежных агентов для долгосрочного клинического мониторинга.
Источник: arXiv cs.AI ↗
