От кратких вопросов к реальной клинической практике
Большинство существующих тестов для медицинских LLM сводятся к проверке знаний по коротким контекстам или использованию инструментов. Однако реальная медицина — это процесс, растянутый во времени. Врачи должны агрегировать данные из множества визитов, анализов и меняющихся схем лечения. Исследователи из команды, представившей работу на MICCAI 2026, создали LongMedBench — бенчмарк, имитирующий именно такие долгосрочные взаимодействия (long-horizon).
Масштаб данных: 335 пациентов и тысячи событий
Для создания набора данных использовалась воспроизводимая пайплайн-обработка записей MIMIC-IV. Данные трансформированы в временные ряды событий и наборы памяти с длинным контекстом. Это позволяет тестировать агентов в условиях, максимально близких к реальности, где информация поступает порциями в разные сессии.
| Параметр | Значение |
|---|---|
| Количество пациентов | 335 |
| Среднее число госпитализаций на пациента | 19.72 |
| Среднее число медицинских событий за визит | 44.91 |
| Источник данных | MIMIC-IV (EHR и клинические заметки) |
Три уровня сложности: от фактов к рассуждениям
Авторы предложили таксономию из трех suites (наборов задач), которые оценивают разные аспекты работы агента:
- Fact-based QA: Поиск конкретных фактов в истории болезни.
- Temporal reasoning: Вывод временных связей (например, что предшествовало чему).
- Long-horizon decision-making: Принятие клинических решений на основе всей накопленной истории.
Главный инсайт: RAG не спасает от провалов в решениях
Эксперименты показали парадоксальный результат. Современные LLM отлично справляются с явными временными метками. Однако они испытывают серьезные трудности с имплицитным выводом времени (когда время нужно угадать по контексту).
Самое важное открытие касается архитектуры: системы RAG (Retrieval-Augmented Generation) и внешняя память агентов действительно улучшают извлечение информации. Но для задач принятия решений производительность критически зависит от непосредственного контекста модели (immediate context). Если модель не может удержать всю цепочку рассуждений в текущем окне, она ошибается, даже если вся информация технически доступна в базе знаний.
Почему это важно
Результаты LongMedBench сигнализируют о том, что просто «подключить базу знаний» к LLM недостаточно для создания надежных медицинских ассистентов. Индустрии нужно фокусироваться на улучшении механизмов удержания долгосрочного контекста и логического вывода, а не только на поиске документов.
Источник: arXiv cs.AI ↗
