От пассивного ответа к активному расследованию
Современные большие языковые модели (LLM) часто работают по принципу «пассивного вывода», предполагая, что вся необходимая информация уже предоставлена. Однако реальная клиническая диагностика — это итеративный процесс, требующий стратегического сбора улик. Авторы работы, опубликованной в arXiv (3 июля 2026 г.), предлагают формализовать медицинскую диагностику как задачу поиска улик (Evidence-Seeking Task). Их цель — научить ИИ не просто генерировать текст, а самостоятельно принимать решения о том, какие дополнительные данные (анализы, опросы) нужны для постановки точного диагноза.
Архитектура: RLVR и симулятор RAGES
Для реализации этого подхода команда разработала замкнутую среду обучения, использующую Reinforcement Learning with Verifiable Rewards (RLVR). Ключевым компонентом системы стал Retrieval-Augmented Generation-based Examination Simulator (RAGES) — высокоточный клинический оракул. RAGES генерирует реалистичные, основанные на знаниях ответы на запросы модели, имитируя поведение пациента или результаты медицинских тестов. Это позволяет модели обучаться в условиях, близких к реальным, где информация поступает порциями.
Метрики и результаты
Эмпирические тесты показали, что внедрение RLVR и RAGES позволяет LLM трансформироваться из простых помощников в автономных диагностов. Модель демонстрирует результаты, сопоставимые с более крупными базовыми моделями, обладающими усиленными способностями к рассуждению. При этом симулятор RAGES превосходит обычные LLM в генерации биологически правдоподобной клинической обратной связи, что критически важно для доверия к системе.
| Компонент системы | Роль в архитектуре | Ключевое преимущество |
|---|---|---|
| RLVR | Метод обучения с подкреплением | Обеспечивает точность диагноза и согласованность действий через верифицируемые награды |
| RAGES | Симулятор клинического осмотра | Генерирует реалистичные, основанные на знаниях улики (evidence) для итеративного обучения |
| LLM (обученная) | Агент-диагност | Переход от пассивного ответа к активному стратегическому поиску информации |
Значение для отрасли
Данная работа закрывает важный пробел между теоретическими возможностями LLM и практическими требованиями медицины. Переход к итеративному поиску улик снижает риск галлюцинаций, вызванных неполными данными, и делает ИИ-ассистентов более надежными инструментами поддержки врачебных решений. Использование верифицируемых наград (Verifiable Rewards) позволяет объективно оценивать качество рассуждений модели, а не только лингвистическую грамотность ответов.
Источник: arXiv cs.AI ↗
