Проблема несовершенных референсов
Существующие пайплайны извлечения клинических таймлайнов из медицинских отчетов (case reports) часто оцениваются по экспертным референсам, которые сами по себе содержат ошибки. Это приводит к неточному выравниванию событий и искаженной оценке качества моделей. Команда исследователей во главе с Джеком Камминсом (Jack Cummins) разработала GAVEL (Grounded Adjudication of Variations across Extracted TimeLines) — протокол, использующий LLM в роли «судьи».
Методология: LLM как арбитр
GAVEL не считает ни одну из извлеченных временных линий абсолютной истиной. Вместо этого система сравнивает две таймлайны непосредственно с исходным медицинским отчетом. Для каждой выявленной разницы LLM возвращает:
- Тип расхождения (discrepancy type).
- Вердикт (verdict).
- Цитату из отчета, подтверждающую или опровергающую факт.
Результаты тестирования
Исследование охватило 1,26 медицинских отчетов. Были протестированы шесть LLM-экстракторов и два аннотатора-человека. В качестве источников данных использовались модели GPT-5.6sol и DeepSeek V3.2. Всего было проанализировано 2,738 находок.
Ключевые метрики точности вердиктов GAVEL:
| Метрика | Значение | Примечание |
|---|---|---|
| True Match Rate (ниже порога 0.10) | 60% | Вероятность истинного совпадения |
| True Match Rate (выше порога 0.10) | 48% | Вероятность истинного совпадения |
| Подтверждение ручным ревью | 89.4% / 88.6% | Доля верных вердиктов GAVEL, подтвержденных экспертами |
| Предпочтение слитых таймлайнов | 77.0% | 95% CI: 69.8–84.1% |
| Снижение расхождений | с 7.63 до 0.85 | Расхождений на один отчет после применения GAVEL |
Значение для индустрии
Результаты показывают, что использование GAVEL для «слияния» (merging) таймлайнов позволяет значительно повысить их качество. Расхождения, приписываемые оцениваемой таймлайне, сократились почти в 9 раз (с 7.63 до 0.85 на отчет). Это открывает путь к созданию более надежных систем автоматического анализа медицинских историй болезни, где критически важна точность хронологии событий.
Работа представлена к конференции AMIA Informatics Summit 2027 и доступна в preprint-архиве arXiv (2609.13475).
Источник: arXiv cs.AI ↗
