Исследования3 октября 2026 г., 04:21 МСК🤖 Auto

KlinikeBench: ИИ ставит диагноз верно, но проваливает прием

Новый бенчмарк KlinikeBench показал, что даже топовые модели (GPT-6-astra, Claude Opus 5) успешно проходят только 30% клинических сценариев, несмотря на 90% точность диагностики.

Баннер новости 8832

Проблема «идеального диагноза»

Большинство существующих клинических бенчмарков оценивают языковые модели (LM) по одному параметру: способности поставить диагноз на основе полной истории болезни. Однако в реальной практике пациенты часто не могут четко сформулировать симптомы, а врачам необходимо самостоятельно собирать анамнез, назначать обследования и принимать решения в условиях неопределенности. Точность диагноза сама по себе не гарантирует, что агент провел адекватную клиническую оценку.

Что такое KlinikeBench

Авторы представили KlinikeBench — первый бенчмарк, оценивающий полный цикл клинического взаимодействия. В набор данных входят 333 задачи, созданные и верифицированные более чем 35 практикующими врачами. Каждая задача представляет собой изолированную среду с виртуальным пациентом, клиническими инструментами и строгими критериями успеха. Модель имеет фиксированный бюджет диалоговых шагов, в течение которых должна собрать историю, запросить анализы и зафиксировать диагноз.

Результаты тестирования

Исследование охватило 31 модель из 7 семейств. Результаты выявили критический разрыв между способностью модели «читать» готовые истории болезни и ее умением вести диалог. Даже самые передовые модели, такие как GPT-6-astra и Claude Opus 5, демонстрируют точность диагностики на уровне 90.7% при работе с полными данными, но их успех в интерактивных сценариях падает ниже 30%.

Метрика / Модель Результат Комментарий
Точность диагностики (полные данные) 90.7% Высокий показатель у топовых моделей (GPT-6-astra, Claude Opus 5)
Успешность в интерактивном приеме < 30% Большинство задач провалены из-за ошибок в сборе анамнеза
Количество задач в бенчмарке 333 Авторизовано практикующими врачами
Участники валидации 35+ Профессиональные клиницисты оценивали качество диалогов

Почему это важно

Клиницисты дали более высокие оценки качеству симулированных диалогов ИИ, чем референсным разговорам, адаптированным из реальных записей. Это указывает на то, что текущие модели могут быть «слишком идеальными» или неестественными в коммуникации. KlinikeBench демонстрирует, что для внедрения ИИ в медицину недостаточно просто учить модели ставить диагнозы — необходимо развивать навыки сбора информации и взаимодействия с пациентом.

Источник: arXiv cs.CL ↗