Исследования3 августа 2026 г., 12:18 МСК🤖 Auto

EarlyDx: LLM не справляются с ранней диагностикой в приемном покое

Исследователи представили EarlyDx — первый бенчмарк для оценки способности ИИ ставить диагнозы на основе только первичных данных. Ни одна модель, включая специализированные медицинские, не достигла уровня врача.

Баннер новости 4943

Проблема закрытых датасетов

Существующие бенчмарки для клинической диагностики (например, MIMIC-IV в стандартном использовании) имеют критические недостатки для реальной急诊-практики: они ограничивают предсказание закрытым набором кодов (ICD), исключают свободный текст и используют диагнозы выписки (discharge diagnoses) в качестве ground truth. Это некорректно, так как диагноз выписки формируется с учетом всего стационарного лечения, а не только первичного осмотра.

Что такое EarlyDx

Команда авторов во главе с Цзяхуи Ли (Jiahui Li) создала EarlyDx — масштабный бенчмарк на основе 154 834 эпизодов посещения отделения неотложной помощи (ED) из MIMIC-IV. Ключевые особенности:

  • Ограничение по времени: используются только данные, доступные в момент поступления ($t_0$).
  • Открытый формат: требуется генерация свободного текста (open-ended), а не выбор из списка.
  • LLM-аудитор: каждая сгенерированная гипотеза проверяется на наличие доказательств в исходных данных. Оцениваются только те диагнозы, которые полностью подтверждены (fully supported).

Результаты тестирования

Исследователи протестировали модели разных классов: универсальные LLM, медицинские специализированные модели и модели, дообученные на клинических данных. Результаты оказались разочаровывающими:

Тип модели Метрика (Inference Recall) Комментарий
Zero-shot (без дообучения) 3–31% Модели в основном копируют текст из истории болезни, но не умеют делать выводы.
Post-trained (с дообучением) 56% Улучшение есть, но значительный разрыв с требуемым уровнем остается.
Человек-врач Ни одна система не достигла баланса чувствительности и точности, необходимого для критических состояний.

Почему это важно

Результаты показывают, что современные LLM не готовы к роли «первого фильтра» в приемном покое. Они способны извлекать факты, но не способны синтезировать разрозненные симптомы в обоснованный диагноз на основе ограниченной информации. Исследователи опубликовали полный пайплайн построения и оценки датасета, открывая путь для создания более надежных систем поддержки принятия решений.

Источник: arXiv cs.AI ↗