Исследования31 июля 2026 г., 07:17 МСК🤖 Auto

ClinLens: AI-агенты для клинических данных провалили тест на 97%

Новый бенчмарк ClinLens показал, что современные LLM не готовы к сложному анализу медицинских данных: лучшие модели решают лишь 56.3% задач, а специализированные системы — менее 3%.

Баннер новости 4781

Проблема: разрыв между кодом и клинической точностью

Исследователи из команды Yuan Zhu, Ethan B. Liu, Frank Nie и Jindong Han представили ClinLens — первый крупный бенчмарк для оценки AI-агентов в долгосрочном (long-horizon) анализе мультимодальных клинических данных. В отличие от существующих тестов, которые изолируют вопросы или табличные данные, ClinLens требует от агентов работы с гетерогенными longitudinal-записями: электронными медкартами, текстовыми заметками, ЭКГ, рентгеном и эхокардиограммами.

Ключевая проблема, выявленная в исследовании, — огромный разрыв между выполнимостью кода (EXECSUCCESS) и клинической корректностью ответа (STRICTPASS). Агенты могут запускать скрипты, но часто выдают неверные выводы из-за ошибок в семантике когорты или временных рамках.

Методология: 200 задач и 4x5 таксономия

Бенчмарк построен на пяти связанных ресурсах MIMIC и включает 200 исполняемых задач. Для оценки используется строгая система «reverse synthesis» (обратного синтеза), где каждый пакет данных сопоставляется с эталонным рабочим процессом. Оценка проводится по таксономии 4x5, которая комбинирует:

  • 4 временных масштаба пациента: от разовых визитов до долгосрочных траекторий.
  • 5 аналитических возможностей: от простой агрегации до сложного причинно-следственного вывода.

Для финального тестирования был отобран фиксированный набор из 126 задач, на котором проводилось сравнение моделей.

Результаты: провал специализированных систем

Результаты тестирования 24 конфигураций моделей и специализированных биомедицинских систем показали катастрофически низкие показатели клинической точности. Даже самые продвинутые модели, способные гарантированно запускать код (100% EXECSUCCESS), не справляются с логикой анализа.

Тип агента / Модель EXECSUCCESS (%) STRICTPASS (%) Комментарий
Лучшая стандартная модель (из 24) 100.0 56.3 Код работает, но выводы верны лишь в половине случаев
Кодовый агент (Coding Agent) Информация недостаточна 65.9* Решил 83 из 126 задач (65.9%)
5 биомедицинских систем (на базе GPT-4o-mini) Информация недостаточна ≤ 2.9 Критический провал в клинической логике

*Расчетное значение на основе доли решенных задач (83/126).

Почему это важно

Результаты ClinLens демонстрируют, что текущие LLM-агенты не готовы к автономной работе в клинической науке. Способность запустить Python-скрипт не равна способности провести корректное медицинское исследование. Для внедрения AI в обработку longitudinal-данных необходимы новые подходы к верификации семантики когорты и временных зависимостей, а не просто улучшение генерации кода.

Источник: arXiv cs.AI ↗