Проблема: статичные модели против живых данных
Медицинские знания обновляются непрерывно, но параметрическая память больших языковых моделей (LLM) фиксируется в момент обучения. Попытки использовать Retrieval-Augmented Generation (RAG) часто приводят к обратному эффекту: извлеченные документы могут быть нерелевантными, неполными или содержать противоречия, что снижает фактологическую точность ответов.
Решение: архитектура CLEAR
Команда во главе с Шуаем Вангом (Shuai Wang) разработала CLEAR (Cross-Source Evidence Adjudication for Large Language Models in Medicine). Это агентная система, которая не просто ищет информацию, а проводит «судебное разбирательство» между тремя независимыми источниками знаний:
- Параметрические знания: то, что модель «помнит» из обучения.
- Локальные корпусы: внутренняя, курируемая база данных.
- Динамически извлеченные данные: результаты поиска в реальном времени.
Механика работы: от верификации до аудита
Ядро системы — Aggregation Verifier (агрегирующий верификатор). Он оценивает кандидаты на ответ, опору (evidence), происхождение данных и качество источников. Если выявляются конфликты, вступает в силу модуль Adjudication (судьи), использующий два механизма:
- Override-guard: механизм блокировки переопределения, защищающий от необоснованных изменений.
- Challenge-audit: механизм оспаривания и аудита, требующий доказательств для изменения вывода.
Если конфликт остается неразрешенным, система инициирует целевой повторный поиск и пересмотр.
Значение для отрасли
Статья (31 страница) демонстрирует переход от простого RAG к сложным многоагентным системам, способным к саморефлексии. Для медицинского ИИ это критически важно: ошибка в фактологии может стоить жизни, а CLEAR предлагает способ минимизировать такие риски за счет перекрестной проверки, а не слепого доверия к одному источнику.
Источник: arXiv cs.AI ↗
