Проблема валидации ИИ в медицине
Внедрение систем искусственного интеллекта в психиатрический прием требует не просто технологической готовности, но и строгих клинических стандартов качества. Главная сложность заключается в том, что разные врачи используют различные стили интервьюирования. Чтобы оценить ИИ-инструменты объективно, необходима платформа, которая минимизирует нагрузку на врачей и измеряет показатели, имеющие реальное клиническое значение.
Решение: InterviewPlayground
Команда исследователей во главе с Кингом Ши (King Shi) из Johns Hopkins Medicine представила платформу InterviewPlayground. Это система оценки, основанная на симуляторе пациентов с дополненной памятью. Платформа позволяет проводить открытые интервью с интерактивными виртуальными пациентами, созданными на основе экспертно составленных клинических сценариев (вижнов). Это создает контролируемую среду для тестирования ИИ-интервьюеров без риска для реальных пациентов.
Результаты пилотного исследования
В ходе пилотного теста 6 клинических специалистов оценивали работу LLM-интервьюера (на базе GPT) в течение 25 минут. Результаты выявили парадоксальную картину: ИИ превосходит врачей в сборе фактов, но уступает в клинической осторожности и интерпретации.
| Метрика | LLM (GPT-based) | Клиницисты (6 экспертов) | Вывод |
|---|---|---|---|
| Сбор клинически значимых симптомов | 88.0% | 38.9% | ИИ эффективнее выявляет симптомы |
| Клинические выводы без оснований | 56.8% | 27.8% | ИИ чаще «галлюцинирует» диагнозы |
| Выявление рисков безопасности | 33.3% | 66.7% | ИИ упускает критические угрозы |
Почему это важно
Исследование подчеркивает, что высокая точность сбора анамнеза (88% против 38.9%) не делает ИИ готовым к автономной работе. Критический недостаток — склонность модели делать необоснованные клинические выводы (56.8% случаев) и низкая способность идентифицировать риски безопасности (33.3% против 66.7% у врачей). Это указывает на необходимость разработки систем «человек в контуре» (human-in-the-loop), где ИИ выступает как ассистент для сбора данных, а окончательная оценка рисков и постановка диагноза остаются за специалистом.
Источник: arXiv cs.AI ↗
