Проблема изолированных ИИ-моделей
Диагностика заболеваний щитовидной железы по данным УЗИ требует комплексного подхода: локализация поражения, измерение размеров, стратификация риска и составление заключения. Большинство существующих ИИ-систем решают эти задачи изолированно, не предоставляя врачу единой картины и возможности проверки. Команда исследователей во главе с Хаифанем Гунгом (Haifan Gong) предложила решение — ThyroidXAgent, интерактивную систему на базе агентов, которая координирует работу специализированных инструментов и сохраняет результаты как аудируемую доказательную базу (auditable evidence record).
Масштаб данных и архитектура
Система обучена на базе OpenThyroidDB — мультицентровом ресурсе, включающем около 300 000 изображений УЗИ и 24 000 парных медицинских заключений. Оценка проводилась на 28 458 независимых случаях, включая 8 721 случай из когорты NHC-MISD-TUS (35 медицинских центров). Ключевая особенность архитектуры — возможность коррекции результатов врачом, что делает систему не «черным ящиком», а инструментом поддержки принятия решений.
Ключевые метрики эффективности
ThyroidXAgent продемонстрировал высокую точность в различных задачах диагностики. Ниже приведены основные результаты тестирования на гетерогенных наборах данных:
| Задача | Метрика | Результат |
|---|---|---|
| Сегментация узлов | Средний Dice Score | 87.21% |
| Классификация (доброкачественное/злокачественное) | AUROC | 0.9466 |
| Прогноз метастазирования в лимфоузлы | AUROC | 0.864 |
| Классификация карциномы (фолликулярная vs папиллярная) | AUROC | 0.805 |
Генерация отчетов и влияние на врачей
Для оценки качества медицинских заключений авторы внедрили метрику ThyClinScore, которая показала сильную корреляцию с оценками языковых моделей, учитывающих локализацию. Генерация отчетов на основе доказательной базы (evidence-grounded assembly) превзошла базовые мультимодальные языковые модели в трех когортах.
Интеграция ThyroidXAgent в рабочий процесс врачей дала следующие практические результаты:
- Точность классификации врачами повысилась (конкретный прирост в процентах не указан, но отмечено значительное улучшение).
- Диагностическая согласованность отчетов выросла с 70.3% до 86.2%.
- Время на сегментацию сократилось на 35.9%.
- Время на составление отчета уменьшилось на 27.4%.
Значение для отрасли
Работа демонстрирует переход от простых классификаторов к агентным системам, способным вести диалог с врачом и предоставлять прозрачную аргументацию своих выводов. Это критически важно для внедрения ИИ в клиническую практику, где требуется не только точность, но и возможность аудита каждого шага диагностики.
Источник: arXiv cs.AI ↗
