Исследования3 июля 2026 г., 13:21 МСК🤖 Auto

Почему RL провалился в медицине: анализ MedAgentBench v3

Исследование выявило, что обучение с подкреплением (RL) в клинических агентах уступает SFT из-за «потолка возможностей» и барьера знаний. Представлен новый бенчмарк MedAgentBench v3.

Баннер новости 2842

Проблема «молчаливого завершения» в FHIR

Авторы работы (Ananya Mantravadi, Harshit Rajgarhia и др.) провели аудит бенчмарков MedAgentBench v1 и v2, предназначенных для проверки выполнения клинических протоколов через стандарт FHIR. Выяснилось, что в старых версиях существовал потолок успешности (ceiling) на уровне 41,7%. Это означало, что для агента стратегия бездействия («молчаливое завершение») была доминирующей, так как RL не мог получить достаточный градиент для улучшения.

MedAgentBench v3: 508 задач и новый потолок

Для устранения этих проблем создана версия MedAgentBench v3 (MAB-v3). В датасет включено 508 задач, а целевой потолок успешности снижен до 8,9%, что делает обучение более осмысленным. На этой базе авторы обучили модель Qwen3-8B, чтобы диагностировать структурные барьеры RL.

Два главных препятствия для RL

Эксперименты выявили две критические проблемы, мешающие RL превзойти обучение с учителем (SFT):

  • Capability Ceiling (Потолок возможностей): В 10 из 20 типов задач базовая производительность модели составляла 0%. Без начального знания RL не может начать обучение (нулевой градиент).
  • Format-Knowledge Barrier (Барьер формата и знаний): В 3 из 20 типов задач требуются точные клинические коды, которые невозможно вывести путем простого исследования среды (exploration).

Сравнение RL и SFT

Чистый RL показал результат 18,2% (pass@1), тогда как rule-based SFT достиг 34,1%. Разница в 15,9 процентных пунктов объясняется исключительно указанными барьерами. Авторы предлагают гибридный подход: SFT для инъекции кодов, а RL — для обучения условной логике.

Метрика / Параметр Значение Примечание
Версия бенчмарка MedAgentBench v3 (MAB-v3) 508 задач, потолок 8.9%
Базовая модель Qwen3-8B Использовалась для аудита
Результат RL (pass@1) 18.2% Чистое обучение с подкреплением
Результат SFT (pass@1) 34.1% Rule-based supervised fine-tuning
Типов задач с 0% базой 10 из 20 Проблема «Capability Ceiling»
Типов задач с кодами 3 из 20 Проблема «Format-Knowledge Barrier»

Вывод для индустрии

Работа доказывает, что внедрение RL в клинические агенты требует предварительной подготовки данных. Чистое RL неэффективно там, где агенту не хватает базовых знаний (кодов) или где среда не позволяет их найти. Оптимальная стратегия — использование SFT для заполнения пробелов в знаниях, а RL — для отработки сложных условных сценариев.

Источник: arXiv cs.AI ↗