Проблема: ИИ знает, что написано, но не знает, что работает
Медицинский искусственный интеллект достиг впечатляющих результатов в задачах диагностики и прогнозирования. Однако фундаментальный недостаток заключается в том, что модели обучаются на синтетических данных — текстах научных публикаций и клинических руководствах. Они учатся предсказывать, что должно быть написано в ответе эксперта, а не анализировать реальные исходы лечения пациентов. Это создает иллюзию компетентности, которая не подкрепляется фактической эффективностью терапии.
Почему это критично для безопасности
Автор статьи подчеркивает, что игнорирование реальных данных о результатах лечения (treatment outcomes) серьезно ограничивает потенциал медицинских ИИ. Когда модель опирается на мнения и синтез текстов, она может рекомендовать стандартные протоколы, которые в конкретных клинических случаях оказываются неэффективными или устаревшими. Это уже приводит к дефектам в самых передовых моделях и основных бенчмарках, которые тестируют способность ИИ генерировать «правильные» ответы, а не «эффективные» решения.
Сравнение подходов к обучению
Текущая парадигма обучения противоречит принципам доказательной медицины. Ниже приведена таблица, иллюстрирующая разрыв между тем, как обучают ИИ, и тем, что требуется для реальной помощи:
| Критерий | Текущий подход (Text-based) | Необходимый подход (Outcome-based) |
|---|---|---|
| Источник данных | Научные статьи, клинические гайдлайны, мнения экспертов | Реальные данные о пациентах, исходы лечения, долгосрочные наблюдения |
| Цель обучения | Предсказание текста (Next-token prediction) | Оптимизация клинических исходов (Survival, Recovery rate) |
| Риск | Галлюцинации, следование устаревшим протоколам | Высокая сложность сбора и очистки данных, вопросы приватности |
Вывод: время менять метрики
Статья позиционирует текущее состояние дел как системную ошибку. Пока бенчмарки измеряют способность ИИ цитировать руководства, а не способность улучшать здоровье пациентов, внедрение таких систем в реальную клиническую практику несет риски. Автор призывает сообщество пересмотреть стандарты оценки, сместив фокус с лингвистической точности на клиническую эффективность.
Источник: arXiv cs.AI ↗
