Проблема «одного броска» в медицинской ИИ
Ошибки диагностики остаются одной из главных угроз безопасности пациентов. Большинство современных больших языковых моделей (LLM) подходят к диагностике как к задаче однократного предсказания, что часто приводит к упущению критически важных, но редких патологий. Авторы исследования из Йельского университета и других институтов предлагают решение: AegisDx — фреймворк, ориентированный на безопасность, который имитирует клиническое мышление врача через гипотетико-дедуктивный метод.
Архитектура и ключевые метрики
AegisDx координирует специализированные компоненты LLM с помощью ролевых контрактов, структурированных промежуточных выводов и «ворот верификации» (verification gates). Система не просто выдает диагноз, а принудительно проверяет наличие опасных состояний «must-not-miss» (те, которые нельзя пропустить) и подкрепляет выводы медицинскими доказательствами. Базовой моделью выступала GPT-oss-120B.
Результаты тестирования на реальных клинических случаях демонстрируют значительное преимущество новой архитектуры:
| Источник данных | Метрика | AegisDx | Стандартная LLM |
|---|---|---|---|
| NEJM & JAMA (отчетные случаи) | Top-3 точность | 62.7% | 51.4% |
| Annals of Emergency Medicine | Top-3 точность | 85.7% | 68.6% |
| Реальные случаи (Yale New Haven) | Выявление «must-not-miss» (Top-3) | 78.0% | 52.0% |
Валидация врачами
Особое внимание уделено реальной клинической полезности. В слепом исследовании 43 записей из отделения неотложной помощи Йель-Нью-Хейвен врачи оценивали безопасность и качество рассуждений. AegisDx показал улучшение composite safety score с 4.31 до 4.55 по 5-балльной шкале (p = 2.1x10^-4) по сравнению с GPT-5. Это подтверждает, что инженерия ИИ как системы безопасности, а не просто предиктора, создает более прозрачный и надежный инструмент поддержки принятия решений.
Источник: arXiv cs.AI ↗
