Проблема «молчаливого завершения» в FHIR
Авторы работы (Ananya Mantravadi, Harshit Rajgarhia и др.) провели аудит бенчмарков MedAgentBench v1 и v2, предназначенных для проверки выполнения клинических протоколов через стандарт FHIR. Выяснилось, что в старых версиях существовал потолок успешности (ceiling) на уровне 41,7%. Это означало, что для агента стратегия бездействия («молчаливое завершение») была доминирующей, так как RL не мог получить достаточный градиент для улучшения.
MedAgentBench v3: 508 задач и новый потолок
Для устранения этих проблем создана версия MedAgentBench v3 (MAB-v3). В датасет включено 508 задач, а целевой потолок успешности снижен до 8,9%, что делает обучение более осмысленным. На этой базе авторы обучили модель Qwen3-8B, чтобы диагностировать структурные барьеры RL.
Два главных препятствия для RL
Эксперименты выявили две критические проблемы, мешающие RL превзойти обучение с учителем (SFT):
- Capability Ceiling (Потолок возможностей): В 10 из 20 типов задач базовая производительность модели составляла 0%. Без начального знания RL не может начать обучение (нулевой градиент).
- Format-Knowledge Barrier (Барьер формата и знаний): В 3 из 20 типов задач требуются точные клинические коды, которые невозможно вывести путем простого исследования среды (exploration).
Сравнение RL и SFT
Чистый RL показал результат 18,2% (pass@1), тогда как rule-based SFT достиг 34,1%. Разница в 15,9 процентных пунктов объясняется исключительно указанными барьерами. Авторы предлагают гибридный подход: SFT для инъекции кодов, а RL — для обучения условной логике.
| Метрика / Параметр | Значение | Примечание |
|---|---|---|
| Версия бенчмарка | MedAgentBench v3 (MAB-v3) | 508 задач, потолок 8.9% |
| Базовая модель | Qwen3-8B | Использовалась для аудита |
| Результат RL (pass@1) | 18.2% | Чистое обучение с подкреплением |
| Результат SFT (pass@1) | 34.1% | Rule-based supervised fine-tuning |
| Типов задач с 0% базой | 10 из 20 | Проблема «Capability Ceiling» |
| Типов задач с кодами | 3 из 20 | Проблема «Format-Knowledge Barrier» |
Вывод для индустрии
Работа доказывает, что внедрение RL в клинические агенты требует предварительной подготовки данных. Чистое RL неэффективно там, где агенту не хватает базовых знаний (кодов) или где среда не позволяет их найти. Оптимальная стратегия — использование SFT для заполнения пробелов в знаниях, а RL — для отработки сложных условных сценариев.
Источник: arXiv cs.AI ↗
