Проблема: разрыв между кодом и клинической точностью
Исследователи из команды Yuan Zhu, Ethan B. Liu, Frank Nie и Jindong Han представили ClinLens — первый крупный бенчмарк для оценки AI-агентов в долгосрочном (long-horizon) анализе мультимодальных клинических данных. В отличие от существующих тестов, которые изолируют вопросы или табличные данные, ClinLens требует от агентов работы с гетерогенными longitudinal-записями: электронными медкартами, текстовыми заметками, ЭКГ, рентгеном и эхокардиограммами.
Ключевая проблема, выявленная в исследовании, — огромный разрыв между выполнимостью кода (EXECSUCCESS) и клинической корректностью ответа (STRICTPASS). Агенты могут запускать скрипты, но часто выдают неверные выводы из-за ошибок в семантике когорты или временных рамках.
Методология: 200 задач и 4x5 таксономия
Бенчмарк построен на пяти связанных ресурсах MIMIC и включает 200 исполняемых задач. Для оценки используется строгая система «reverse synthesis» (обратного синтеза), где каждый пакет данных сопоставляется с эталонным рабочим процессом. Оценка проводится по таксономии 4x5, которая комбинирует:
- 4 временных масштаба пациента: от разовых визитов до долгосрочных траекторий.
- 5 аналитических возможностей: от простой агрегации до сложного причинно-следственного вывода.
Для финального тестирования был отобран фиксированный набор из 126 задач, на котором проводилось сравнение моделей.
Результаты: провал специализированных систем
Результаты тестирования 24 конфигураций моделей и специализированных биомедицинских систем показали катастрофически низкие показатели клинической точности. Даже самые продвинутые модели, способные гарантированно запускать код (100% EXECSUCCESS), не справляются с логикой анализа.
| Тип агента / Модель | EXECSUCCESS (%) | STRICTPASS (%) | Комментарий |
|---|---|---|---|
| Лучшая стандартная модель (из 24) | 100.0 | 56.3 | Код работает, но выводы верны лишь в половине случаев |
| Кодовый агент (Coding Agent) | Информация недостаточна | 65.9* | Решил 83 из 126 задач (65.9%) |
| 5 биомедицинских систем (на базе GPT-4o-mini) | Информация недостаточна | ≤ 2.9 | Критический провал в клинической логике |
*Расчетное значение на основе доли решенных задач (83/126).
Почему это важно
Результаты ClinLens демонстрируют, что текущие LLM-агенты не готовы к автономной работе в клинической науке. Способность запустить Python-скрипт не равна способности провести корректное медицинское исследование. Для внедрения AI в обработку longitudinal-данных необходимы новые подходы к верификации семантики когорты и временных зависимостей, а не просто улучшение генерации кода.
Источник: arXiv cs.AI ↗
