Проблема «галлюцинаций» в медицине
В клинической практике недопустимы ошибки, основанные на вымышленных фактах. Существующие медицинские LLM часто либо не имеют доступа к доказательствам, либо используют их пассивно, не контролируя процесс оценки. FaithMed решает эту проблему, формализуя принципы доказательной медицины как критерии на уровне каждого шага рассуждения.
Методология: RL с процессным вознаграждением
Авторы (Zhiyun Zhang, Liwen Sun, Xiang Qian, Chenyan Xiong) внедрили фреймворк, сочетающий рубрики, разработанные клиницистами и автоматически уточненные, с обучением с подкреплением (RL). Ключевая инновация — назначение вознаграждения на уровне каждого шага (step-level process reward) и использование группирования преимуществ (advantage grouping). Это заставляет модель не просто искать ответ, но и обосновывать каждый логический переход ссылками на надежные источники.
Результаты бенчмарков
Тестирование проводилось на семи медицинских бенчмарках. FaithMed демонстрирует статистически значимое превосходство над базовыми агентами с поиском (agentic-search) и стандартным RL, ориентированным только на результат. Особенно заметен рост качества обоснований (rubric scores).
| Метрика / Сравнение | Результат улучшения | Примечание |
|---|---|---|
| Средний балл по 7 бенчмаркам | +9% | Против агентов с поиском (agentic-search baselines) |
| Качество решения задачи | +5.8% | Против RL только по результату (outcome-only RL) |
| Оценка по рубрикам EBM | +15.5% | Против агентов на базе Qwen3 с поиском |
Значение для отрасли
Работа доказывает, что явное пошаговое обучение (explicit step-level supervision) критически важно для создания доверенных медицинских ИИ-ассистентов. Код фреймворка уже доступен, что открывает путь для внедрения подобных методов в другие узкоспециализированные области, где важна прозрачность логики.
Источник: arXiv cs.CL ↗
