Суть исследования: автоматизация против критического мышления
Новое исследование, опубликованное в Nature Medicine и проведенное MIT, Columbia University и Stanford University, выявило критический парадокс в использовании ИИ для диагностики кожных заболеваний. Оказалось, что «универсальный» подход к объяснимому ИИ (XAI) не работает: один и тот же инструмент помогает экспертам, но вводит в заблуждение новичков.
Команда под руководством Марзиех Гхассеми (MIT) и Орсона Сю (Columbia) протестировала две группы: неэкспертов (пациентов) и врачей первичного звена. Задача заключалась в оценке изображений родинок на наличие рака. ИИ предоставлял предсказание с различными типами объяснений: от тепловых карт до текстовых комментариев от больших языковых моделей (LLM).
Ключевые цифры и метрики
Результаты четко разделили группы по уровню доверия к алгоритмам. Неэксперты демонстрировали рост точности, но исключительно за счет эффекта «deference» (подчинения модели). Если ИИ ошибался, неэксперты все равно выбирали его версию, становясь еще более уверенными в ошибочном диагнозе. Врачи же игнорировали неверные объяснения, опираясь на свой клинический опыт.
| Параметр | Неэксперты (Пациенты) | Клиницисты (Врачи) |
|---|---|---|
| Реакция на ошибку ИИ | Слепое доверие, снижение точности | Игнорирование, сохранение точности |
| Лучший метод объяснения | LLM (текстовое объяснение) — повышает уверенность, даже если она ложная | Отсутствие объяснения (только предсказание) |
| Влияние LLM-объяснений | Максимальное: пользователи верят «умному» тексту, даже если он неверен | Минимальное: врачи проверяют логику ИИ против своей базы знаний |
| Эффект тайминга | Показ объяснения ДО диагноза усиливает зависимость от ИИ | Менее подвержены влиянию порядка подачи информации |
Почему это важно для индустрии MedTech
Исследование ставит под сомнение текущую тенденцию внедрения LLM в медицинские интерфейсы. Как отмечает соавтор Роксана Данешджоу (Stanford), люди с наименьшими медицинскими знаниями — те, кто чаще всего обращается к ИИ для самодиагностики, — наиболее уязвимы к алгоритмическим ошибкам.
Авторы предлагают изменить архитектуру взаимодействия: вместо того чтобы давать ИИ-объяснение первым, система должна сначала заставить пользователя сформулировать собственную гипотезу. Только затем ИИ может предложить альтернативные варианты, стимулируя критическое мышление, а не автоматическое подчинение.
Выводы для разработчиков
- Избегайте «анкоринга»: Подача объяснения до самостоятельной оценки пользователя резко снижает его точность.
- LLM — это риск: Убедительный, но ложный текст от LLM опаснее, чем просто сырой прогноз модели.
- Персонализация интерфейса: Системы должны адаптировать уровень детализации объяснений под компетенцию пользователя, чтобы не создавать иллюзию компетентности там, где ее нет.
Источник: MIT News AI ↗
