Проблема закрытых датасетов
Существующие бенчмарки для клинической диагностики (например, MIMIC-IV в стандартном использовании) имеют критические недостатки для реальной急诊-практики: они ограничивают предсказание закрытым набором кодов (ICD), исключают свободный текст и используют диагнозы выписки (discharge diagnoses) в качестве ground truth. Это некорректно, так как диагноз выписки формируется с учетом всего стационарного лечения, а не только первичного осмотра.
Что такое EarlyDx
Команда авторов во главе с Цзяхуи Ли (Jiahui Li) создала EarlyDx — масштабный бенчмарк на основе 154 834 эпизодов посещения отделения неотложной помощи (ED) из MIMIC-IV. Ключевые особенности:
- Ограничение по времени: используются только данные, доступные в момент поступления ($t_0$).
- Открытый формат: требуется генерация свободного текста (open-ended), а не выбор из списка.
- LLM-аудитор: каждая сгенерированная гипотеза проверяется на наличие доказательств в исходных данных. Оцениваются только те диагнозы, которые полностью подтверждены (fully supported).
Результаты тестирования
Исследователи протестировали модели разных классов: универсальные LLM, медицинские специализированные модели и модели, дообученные на клинических данных. Результаты оказались разочаровывающими:
| Тип модели | Метрика (Inference Recall) | Комментарий |
|---|---|---|
| Zero-shot (без дообучения) | 3–31% | Модели в основном копируют текст из истории болезни, но не умеют делать выводы. |
| Post-trained (с дообучением) | 56% | Улучшение есть, но значительный разрыв с требуемым уровнем остается. |
| Человек-врач | — | Ни одна система не достигла баланса чувствительности и точности, необходимого для критических состояний. |
Почему это важно
Результаты показывают, что современные LLM не готовы к роли «первого фильтра» в приемном покое. Они способны извлекать факты, но не способны синтезировать разрозненные симптомы в обоснованный диагноз на основе ограниченной информации. Исследователи опубликовали полный пайплайн построения и оценки датасета, открывая путь для создания более надежных систем поддержки принятия решений.
Источник: arXiv cs.AI ↗
