Проблема: Оценка будущего через призму прошлого
Клинические решения всегда проспективны (принимаются до исхода), но большинство бенчмарков для LLM используют ретроспективные записи, где уже известны диагноз и ответ на лечение. Авторы исследования вводят понятие hindsight bias (искажения hindsight) в контексте временного анализа: модели начинают использовать информацию, которая стала доступна только после принятия решения, имитируя понимание, которого не было в момент клинического выбора.
Методология: 171 случай и временные маски
Команда разработала парный бенчмарк на базе 171 кейса из PubMed Central (40 случаев сепсиса и 131 случай GLP-1/диабета). Данные представлены в двух форматах: текстовые нарративы и аннотированные временные серии (TTS). Ключевой элемент — вопросы привязаны к клинически значимой временной отметке (cutoff). Модель должна ответить, опираясь либо на данные до этой отметки, либо на полный таймлайн.
Результаты: Топовые модели подвержены искажению
Исследование оценило четыре метрики: точность (Acc), уровень ловушки hindsight (HTR), нестабильность ответов (AIR) и уровень bias (HBR). Оказалось, что доступ к полному таймлайну вызывает стабильные сдвиги в суждениях моделей, зависящие от исхода. Однако применение временного маскирования (temporal masking) снижает bias, не ухудшая общую точность.
| Модель | Условие | Ключевой эффект |
|---|---|---|
| GPT 5.6 Sol | Полный таймлайн | Высокий HBR (зависимость от исхода) |
| Gemma 4 | Полный таймлайн | Заметный сдвиг в суждениях |
| GLM 5.2 | Полный таймлайн | Использование будущей информации |
| Opus 5 | Полный таймлайн | Снижение объективности |
| Все модели | Временное маскирование | Снижение bias без потери Acc |
Почему это важно для индустрии
Результаты ставят под сомнение валидность текущих клинических бенчмарков. Если модель «угадывает» правильный ответ, просто читая заключение врача в конце истории болезни, она не способна к реальному прогностическому reasoning. Внедрение временного разделения данных (masking) в процесс обучения и оценки необходимо для создания действительно надежных ассистентов, способных работать в условиях неопределенности, а не просто ретроспективно анализировать уже случившееся.
Источник: arXiv cs.CL ↗
