Проблема: LLM не справляются с долгосрочными данными
Интерпретация клинических оценок при болезни Паркинсона требует времени и экспертизы. Обычные большие языковые модели (LLM) часто генерируют неточные или противоречивые ответы, так как не обладают достаточным клиническим контекстом и плохо работают с временной последовательностью данных (longitudinal data). Это критично для отслеживания динамики заболевания у пациента.
Решение: Архитектура MA-RAG
Команда авторов (Sana Alamgeer, Denise Goberta, Muhammad Irshad, Anne H. H. Ngu) предложила фреймворк MA-RAG (Multi-Agent Retrieval-Augmented Generation). Ключевая идея — декомпозиция клинического рассуждения на специализированных агентов. Система не просто ищет информацию, а выполняет четыре конкретных задачи:
- Single-session: анализ одного визита.
- Trajectory: анализ траектории развития болезни.
- Comparison: сравнение показателей.
- Cohort: обобщение данных по когорте пациентов.
Результаты: Прорыв в точности
В ходе оценки MA-RAG сравнивали с базовыми моделями (Traditional, RAG-only, Single-agent RAG). Система продемонстрировала статистически значимое улучшение по ключевым метрикам: Fact Precision (точность фактов), Hallucination Rate (уровень галлюцинаций), Temporal Fidelity (временная достоверность) и Semantic Similarity. Особенно впечатляющим стало снижение уровня галлюцинаций и рост фактической точности.
| Метрика | Базовая модель (Baseline) | MA-RAG | Улучшение |
|---|---|---|---|
| Fact Precision | 0.436 | 0.990 | +122% (относительно) |
| Hallucination Rate | 0.564 | 0.010 | -98% (относительно) |
Значение для медицины
Субъективная оценка клинических экспертов подтвердила, что MA-RAG генерирует наиболее организованные и клинически полезные сводки. Внедрение таких систем может автоматизировать рутинный анализ истории болезни, позволяя врачам фокусироваться на принятии решений, а не на сборе фактов из разрозненных записей.
Источник: arXiv cs.CL ↗
