Исследования13 июля 2026 г., 12:17 МСК🤖 Auto

LongMedBench: Почему LLM проваливают долгосрочные медицинские решения

Исследователи представили LongMedBench — первый бенчмарк для оценки медицинских AI-агентов на основе реальных историй болезни (EHR). Тест выявил критический разрыв между умением моделей искать факты и их неспособностью принимать решения в долгосрочно

Баннер новости 3445

От кратких вопросов к реальной клинической практике

Большинство существующих тестов для медицинских LLM сводятся к проверке знаний по коротким контекстам или использованию инструментов. Однако реальная медицина — это процесс, растянутый во времени. Врачи должны агрегировать данные из множества визитов, анализов и меняющихся схем лечения. Исследователи из команды, представившей работу на MICCAI 2026, создали LongMedBench — бенчмарк, имитирующий именно такие долгосрочные взаимодействия (long-horizon).

Масштаб данных: 335 пациентов и тысячи событий

Для создания набора данных использовалась воспроизводимая пайплайн-обработка записей MIMIC-IV. Данные трансформированы в временные ряды событий и наборы памяти с длинным контекстом. Это позволяет тестировать агентов в условиях, максимально близких к реальности, где информация поступает порциями в разные сессии.

Параметр Значение
Количество пациентов 335
Среднее число госпитализаций на пациента 19.72
Среднее число медицинских событий за визит 44.91
Источник данных MIMIC-IV (EHR и клинические заметки)

Три уровня сложности: от фактов к рассуждениям

Авторы предложили таксономию из трех suites (наборов задач), которые оценивают разные аспекты работы агента:

  • Fact-based QA: Поиск конкретных фактов в истории болезни.
  • Temporal reasoning: Вывод временных связей (например, что предшествовало чему).
  • Long-horizon decision-making: Принятие клинических решений на основе всей накопленной истории.

Главный инсайт: RAG не спасает от провалов в решениях

Эксперименты показали парадоксальный результат. Современные LLM отлично справляются с явными временными метками. Однако они испытывают серьезные трудности с имплицитным выводом времени (когда время нужно угадать по контексту).

Самое важное открытие касается архитектуры: системы RAG (Retrieval-Augmented Generation) и внешняя память агентов действительно улучшают извлечение информации. Но для задач принятия решений производительность критически зависит от непосредственного контекста модели (immediate context). Если модель не может удержать всю цепочку рассуждений в текущем окне, она ошибается, даже если вся информация технически доступна в базе знаний.

Почему это важно

Результаты LongMedBench сигнализируют о том, что просто «подключить базу знаний» к LLM недостаточно для создания надежных медицинских ассистентов. Индустрии нужно фокусироваться на улучшении механизмов удержания долгосрочного контекста и логического вывода, а не только на поиске документов.

Источник: arXiv cs.AI ↗