Исследования28 июля 2026 г., 15:16 МСК🤖 Auto

MedLoCoMo: LLM провалили тест на долгосрочную медицинскую память

Новый бенчмарк MedLoCoMo показал, что даже модели с длинным контекстом не умеют связывать информацию между разными визитами пациента, что критично для реальной клинической практики.

Баннер новости 4541

Проблема существующих бенчмарков

Большинство современных медицинских QA-датасетов тестируют способность моделей работать с коротким контекстом или одним документом. Они не отвечают на главный вопрос: могут ли большие языковые модели (LLM) использовать, связывать и, что важнее, отказываться от ответов, когда информации недостаточно в рамках долгосрочной истории пациента. Авторы исследования Zeyu Zhang, Ziqing Wang и Kaize Ding создали MedLoCoMo, чтобы заполнить этот пробел.

Масштаб и структура данных

Бенчмарк построен на обезличенных записях MIMIC-IV и MIMIC-IV-Note. Исследователи сгенерировали реалистичные диалоги «врач-пациент» и вопросы, требующие поиска доказательств. Ключевая особенность — работа с временными шкалами пациентов, охватывающими множественные госпитализации. Данные включают три типа сценариев: локальные вопросы (в рамках одной госпитализации), кросс-госпитализационные вопросы (связь между визитами) и «враждебные» вопросы, на которые в данных нет ответа.

Ключевые метрики датасета

MedLoCoMo представляет собой сложную среду для тестирования памяти моделей. Ниже приведены средние показатели одного пациентского таймлайна:

Метрика Значение Комментарий
Среднее число реплик (turns) 1,669.8 Высокая детализация диалога
Количество сессий (визитов) 29.7 Охват длительного периода наблюдения
Объем контекста (токенов) 74,512.2 Требует поддержки длинного контекста

Результаты тестирования базовых моделей

Эксперименты показали, что способность к кросс-госпитализационному рассуждению (cross-admission reasoning) стабильно ниже, чем использование локальных доказательств. Это происходит даже у моделей с длинным контекстным окном или использующих внешнюю память и методы поиска (RAG). Модели часто «забывают» важные детали из предыдущих визитов или ошибочно связывают несвязанные события, что делает их использование в реальной клинической практике рискованным без строгой верификации.

Значение для индустрии

Результаты MedLoCoMo подчеркивают разрыв между теоретической длиной контекста LLM и их фактической способностью к логическому связыванию разрозненных фактов. Для разработчиков медицинских AI-ассистентов это сигнал к необходимости улучшения механизмов долгосрочной памяти и контроля за «галлюцинациями» при работе с историей болезни. Код и датасет MedLoCoMo доступны для воспроизведения результатов.

Источник: arXiv cs.AI ↗