Проблема: RAG не умеет «думать» по правилам
Традиционные системы на базе RAG (Retrieval-Augmented Generation) лишь извлекают текст клинических рекомендаций (CPG) или усваивают их через обучение. Они не могут исполнять логические правила, заложенные в протоколы. Это приводит к ошибкам в диагностике, где важна строгая последовательность действий.
Решение: GuideSkill как исполняемый слой
Команда во главе с Ланом Цао (Lang Cao) разработала GuideSkill — внешний слой рассуждений, который компилирует критерии заболеваний в исполняемые функции. Эти функции возвращают ординарные баллы поддержки диагноза. Система работает в два этапа:
- GuideSkill-Zero: Инициализируется напрямую из текстов клинических рекомендаций.
- GuideSkill-Evo: Использует пары «случай-диагноз» для уточнения существующих навыков и добавления новых, отсутствующих в исходных правилах.
Результаты: Превосходство над базовыми методами
Эксперименты проводились на четырех бенчмарках и четырех бэкбонных моделях. Ключевые метрики показывают, что интеграция исполняемых правил значительно превосходит стандартные подходы:
| Метрика / Модель | Результат GuideSkill-Evo | Сравнение (Baseline) |
|---|---|---|
| Macro-average accuracy (vs Guideline RAG) | +13.45% | Против RAG с извлечением текста |
| Macro-average accuracy (vs Direct Inference) | +18.49% | Прямой вывод LLM без правил |
| Покрытие gold-label навыков | 99.5% | Рост с 56.5% (до эволюции) |
| Qwen3.5-9B (vs Parameter-update baseline) | +11.16% | Без обновления весов бэкбона |
Почему это важно для индустрии
Главное преимущество GuideSkill — модель-агностицизм. Механизм не требует переобучения самой LLM (parameter-free update), что снижает вычислительные затраты и риски галлюцинаций. Экспертная оценка врачей подтвердила клиническую состоятельность сгенерированных правил. Это открывает путь к созданию надежных AI-ассистентов, которые не просто «знают» медицину, но и строго следуют алгоритмам лечения.
Источник: arXiv cs.AI ↗
