Исследования15 сентября 2026 г., 10:18 МСК🤖 Auto

GAVEL: LLM-судья для клинических таймлайнов снижает ошибки в 9 раз

Исследователи представили GAVEL — протокол оценки на базе LLM, который сравнивает извлеченные клинические таймлайны с исходными отчетами, снижая количество расхождений с 7.63 до 0.85 на документ.

Баннер новости 7519

Проблема несовершенных референсов

Существующие пайплайны извлечения клинических таймлайнов из медицинских отчетов (case reports) часто оцениваются по экспертным референсам, которые сами по себе содержат ошибки. Это приводит к неточному выравниванию событий и искаженной оценке качества моделей. Команда исследователей во главе с Джеком Камминсом (Jack Cummins) разработала GAVEL (Grounded Adjudication of Variations across Extracted TimeLines) — протокол, использующий LLM в роли «судьи».

Методология: LLM как арбитр

GAVEL не считает ни одну из извлеченных временных линий абсолютной истиной. Вместо этого система сравнивает две таймлайны непосредственно с исходным медицинским отчетом. Для каждой выявленной разницы LLM возвращает:

  • Тип расхождения (discrepancy type).
  • Вердикт (verdict).
  • Цитату из отчета, подтверждающую или опровергающую факт.

Результаты тестирования

Исследование охватило 1,26 медицинских отчетов. Были протестированы шесть LLM-экстракторов и два аннотатора-человека. В качестве источников данных использовались модели GPT-5.6sol и DeepSeek V3.2. Всего было проанализировано 2,738 находок.

Ключевые метрики точности вердиктов GAVEL:

Метрика Значение Примечание
True Match Rate (ниже порога 0.10) 60% Вероятность истинного совпадения
True Match Rate (выше порога 0.10) 48% Вероятность истинного совпадения
Подтверждение ручным ревью 89.4% / 88.6% Доля верных вердиктов GAVEL, подтвержденных экспертами
Предпочтение слитых таймлайнов 77.0% 95% CI: 69.8–84.1%
Снижение расхождений с 7.63 до 0.85 Расхождений на один отчет после применения GAVEL

Значение для индустрии

Результаты показывают, что использование GAVEL для «слияния» (merging) таймлайнов позволяет значительно повысить их качество. Расхождения, приписываемые оцениваемой таймлайне, сократились почти в 9 раз (с 7.63 до 0.85 на отчет). Это открывает путь к созданию более надежных систем автоматического анализа медицинских историй болезни, где критически важна точность хронологии событий.

Работа представлена к конференции AMIA Informatics Summit 2027 и доступна в preprint-архиве arXiv (2609.13475).

Источник: arXiv cs.AI ↗