Исследования21 сентября 2026 г., 09:20 МСК🤖 Auto

AI в психиатрии: LLM собирает 88% симптомов, но галлюцинирует

Исследование Johns Hopkins показало, что ИИ-интервьюер для психиатрического приема эффективнее врачей собирает анамнез, но склонен к ложным выводам и упускает риски суицида.

Баннер новости 7923

Проблема валидации ИИ в медицине

Внедрение систем искусственного интеллекта в психиатрический прием требует не просто технологической готовности, но и строгих клинических стандартов качества. Главная сложность заключается в том, что разные врачи используют различные стили интервьюирования. Чтобы оценить ИИ-инструменты объективно, необходима платформа, которая минимизирует нагрузку на врачей и измеряет показатели, имеющие реальное клиническое значение.

Решение: InterviewPlayground

Команда исследователей во главе с Кингом Ши (King Shi) из Johns Hopkins Medicine представила платформу InterviewPlayground. Это система оценки, основанная на симуляторе пациентов с дополненной памятью. Платформа позволяет проводить открытые интервью с интерактивными виртуальными пациентами, созданными на основе экспертно составленных клинических сценариев (вижнов). Это создает контролируемую среду для тестирования ИИ-интервьюеров без риска для реальных пациентов.

Результаты пилотного исследования

В ходе пилотного теста 6 клинических специалистов оценивали работу LLM-интервьюера (на базе GPT) в течение 25 минут. Результаты выявили парадоксальную картину: ИИ превосходит врачей в сборе фактов, но уступает в клинической осторожности и интерпретации.

Метрика LLM (GPT-based) Клиницисты (6 экспертов) Вывод
Сбор клинически значимых симптомов 88.0% 38.9% ИИ эффективнее выявляет симптомы
Клинические выводы без оснований 56.8% 27.8% ИИ чаще «галлюцинирует» диагнозы
Выявление рисков безопасности 33.3% 66.7% ИИ упускает критические угрозы

Почему это важно

Исследование подчеркивает, что высокая точность сбора анамнеза (88% против 38.9%) не делает ИИ готовым к автономной работе. Критический недостаток — склонность модели делать необоснованные клинические выводы (56.8% случаев) и низкая способность идентифицировать риски безопасности (33.3% против 66.7% у врачей). Это указывает на необходимость разработки систем «человек в контуре» (human-in-the-loop), где ИИ выступает как ассистент для сбора данных, а окончательная оценка рисков и постановка диагноза остаются за специалистом.

Источник: arXiv cs.AI ↗