Проблема существующих бенчмарков
Большинство современных медицинских QA-датасетов тестируют способность моделей работать с коротким контекстом или одним документом. Они не отвечают на главный вопрос: могут ли большие языковые модели (LLM) использовать, связывать и, что важнее, отказываться от ответов, когда информации недостаточно в рамках долгосрочной истории пациента. Авторы исследования Zeyu Zhang, Ziqing Wang и Kaize Ding создали MedLoCoMo, чтобы заполнить этот пробел.
Масштаб и структура данных
Бенчмарк построен на обезличенных записях MIMIC-IV и MIMIC-IV-Note. Исследователи сгенерировали реалистичные диалоги «врач-пациент» и вопросы, требующие поиска доказательств. Ключевая особенность — работа с временными шкалами пациентов, охватывающими множественные госпитализации. Данные включают три типа сценариев: локальные вопросы (в рамках одной госпитализации), кросс-госпитализационные вопросы (связь между визитами) и «враждебные» вопросы, на которые в данных нет ответа.
Ключевые метрики датасета
MedLoCoMo представляет собой сложную среду для тестирования памяти моделей. Ниже приведены средние показатели одного пациентского таймлайна:
| Метрика | Значение | Комментарий |
|---|---|---|
| Среднее число реплик (turns) | 1,669.8 | Высокая детализация диалога |
| Количество сессий (визитов) | 29.7 | Охват длительного периода наблюдения |
| Объем контекста (токенов) | 74,512.2 | Требует поддержки длинного контекста |
Результаты тестирования базовых моделей
Эксперименты показали, что способность к кросс-госпитализационному рассуждению (cross-admission reasoning) стабильно ниже, чем использование локальных доказательств. Это происходит даже у моделей с длинным контекстным окном или использующих внешнюю память и методы поиска (RAG). Модели часто «забывают» важные детали из предыдущих визитов или ошибочно связывают несвязанные события, что делает их использование в реальной клинической практике рискованным без строгой верификации.
Значение для индустрии
Результаты MedLoCoMo подчеркивают разрыв между теоретической длиной контекста LLM и их фактической способностью к логическому связыванию разрозненных фактов. Для разработчиков медицинских AI-ассистентов это сигнал к необходимости улучшения механизмов долгосрочной памяти и контроля за «галлюцинациями» при работе с историей болезни. Код и датасет MedLoCoMo доступны для воспроизведения результатов.
Источник: arXiv cs.AI ↗
