Проблема монолитных LLM в медицине
Координация ухода за пациентами требует синтеза разрозненных клинических, функциональных и психосоциальных данных. Традиционные монолитные конвейеры на базе больших языковых моделей (LLM) часто не обеспечивают прозрачности и безопасности, так как не могут объяснить, почему одно вмешательство предпочтительнее другого, и не допускают человеческого контроля на этапе принятия решений.
Архитектура CANOE: 5 модулей
Авторы (Truong Thanh Hung Nguyen и соавторы) предлагают CANOE (Contestable Argumentative Network-of-Experts) — многоагентную систему, состоящую из пяти ключевых модулей:
- Оценка сложности: анализ входных данных пациента.
- Адаптивный набор команды: привлечение нужных специалистов-агентов.
- Аргументативные вычисления: использование Arena-based Quantitative Bipolar Argumentation Framework (A-QBAF). Специализированные агенты генерируют аргументы «за» и «против» кандидатур вмешательств.
- Разрешение конфликтов: споры решаются на «арене» до присвоения баллов приемлемости.
- Человек в контуре: планировщик может принимать, отвергать или редактировать аргументы, после чего система детерминированно пересчитывает план.
Метрики и результаты
Оценка проводилась на датасетах Discharge Me! и MedicalRAG. Исследование показало, что медицинские fine-tuned модели обеспечивают наилучшую клиническую корректность, а структура аргументации CANOE гарантирует объяснимость (faithful explanation) и возможность оспаривания решений человеком.
| Метрика | Значение / Роль |
|---|---|
| ROUGE-L | Оценка качества генерации текста |
| AlignScore | Согласованность с фактами |
| MEDCON F1 | Медицинская точность извлечения/классификации |
| FKGL | Читаемость текста (Flesch-Kincaid) |
| LLM-as-a-judge | Оценка качества экспертом-ИИ |
Почему это важно
Статья принята к публикации на 4-й Международной конференции по передовым технологиям ИИ, этике и междисциплинарным приложениям. Подход CANOE меняет парадигму: от «черного ящика», выдающего готовый план, к системе, где врач видит логику спора между специалистами и влияет на итоговое решение, что критически важно для безопасности пациентов.
Источник: arXiv cs.AI ↗
