Исследования16 сентября 2026 г., 06:17 МСК🤖 Auto

Ловушка hindsight bias: LLM лгут в медицине, зная исход

Исследование arXiv:2609.13454 показало, что топовые LLM (GPT 5.6, Opus 5) теряют точность в клинических задачах, если видят полный анамнез. Включение будущих данных создает «ловушку ретроспективного искажения».

Баннер новости 7596

Проблема: Оценка будущего через призму прошлого

Клинические решения всегда проспективны (принимаются до исхода), но большинство бенчмарков для LLM используют ретроспективные записи, где уже известны диагноз и ответ на лечение. Авторы исследования вводят понятие hindsight bias (искажения hindsight) в контексте временного анализа: модели начинают использовать информацию, которая стала доступна только после принятия решения, имитируя понимание, которого не было в момент клинического выбора.

Методология: 171 случай и временные маски

Команда разработала парный бенчмарк на базе 171 кейса из PubMed Central (40 случаев сепсиса и 131 случай GLP-1/диабета). Данные представлены в двух форматах: текстовые нарративы и аннотированные временные серии (TTS). Ключевой элемент — вопросы привязаны к клинически значимой временной отметке (cutoff). Модель должна ответить, опираясь либо на данные до этой отметки, либо на полный таймлайн.

Результаты: Топовые модели подвержены искажению

Исследование оценило четыре метрики: точность (Acc), уровень ловушки hindsight (HTR), нестабильность ответов (AIR) и уровень bias (HBR). Оказалось, что доступ к полному таймлайну вызывает стабильные сдвиги в суждениях моделей, зависящие от исхода. Однако применение временного маскирования (temporal masking) снижает bias, не ухудшая общую точность.

Модель Условие Ключевой эффект
GPT 5.6 Sol Полный таймлайн Высокий HBR (зависимость от исхода)
Gemma 4 Полный таймлайн Заметный сдвиг в суждениях
GLM 5.2 Полный таймлайн Использование будущей информации
Opus 5 Полный таймлайн Снижение объективности
Все модели Временное маскирование Снижение bias без потери Acc

Почему это важно для индустрии

Результаты ставят под сомнение валидность текущих клинических бенчмарков. Если модель «угадывает» правильный ответ, просто читая заключение врача в конце истории болезни, она не способна к реальному прогностическому reasoning. Внедрение временного разделения данных (masking) в процесс обучения и оценки необходимо для создания действительно надежных ассистентов, способных работать в условиях неопределенности, а не просто ретроспективно анализировать уже случившееся.

Источник: arXiv cs.CL ↗