Исследования7 июля 2026 г., 15:18 МСК🤖 Auto

RLVR и симулятор RAGES: LLM учатся ставить диагнозы через поиск улик

Исследователи представили метод Reinforcement Learning with Verifiable Rewards (RLVR) для обучения LLM клиническому мышлению. Модель переходит от пассивного ответа к активному сбору доказательств с помощью симулятора RAGES.

Баннер новости 3035

От пассивного ответа к активному расследованию

Современные большие языковые модели (LLM) часто работают по принципу «пассивного вывода», предполагая, что вся необходимая информация уже предоставлена. Однако реальная клиническая диагностика — это итеративный процесс, требующий стратегического сбора улик. Авторы работы, опубликованной в arXiv (3 июля 2026 г.), предлагают формализовать медицинскую диагностику как задачу поиска улик (Evidence-Seeking Task). Их цель — научить ИИ не просто генерировать текст, а самостоятельно принимать решения о том, какие дополнительные данные (анализы, опросы) нужны для постановки точного диагноза.

Архитектура: RLVR и симулятор RAGES

Для реализации этого подхода команда разработала замкнутую среду обучения, использующую Reinforcement Learning with Verifiable Rewards (RLVR). Ключевым компонентом системы стал Retrieval-Augmented Generation-based Examination Simulator (RAGES) — высокоточный клинический оракул. RAGES генерирует реалистичные, основанные на знаниях ответы на запросы модели, имитируя поведение пациента или результаты медицинских тестов. Это позволяет модели обучаться в условиях, близких к реальным, где информация поступает порциями.

Метрики и результаты

Эмпирические тесты показали, что внедрение RLVR и RAGES позволяет LLM трансформироваться из простых помощников в автономных диагностов. Модель демонстрирует результаты, сопоставимые с более крупными базовыми моделями, обладающими усиленными способностями к рассуждению. При этом симулятор RAGES превосходит обычные LLM в генерации биологически правдоподобной клинической обратной связи, что критически важно для доверия к системе.

Компонент системы Роль в архитектуре Ключевое преимущество
RLVR Метод обучения с подкреплением Обеспечивает точность диагноза и согласованность действий через верифицируемые награды
RAGES Симулятор клинического осмотра Генерирует реалистичные, основанные на знаниях улики (evidence) для итеративного обучения
LLM (обученная) Агент-диагност Переход от пассивного ответа к активному стратегическому поиску информации

Значение для отрасли

Данная работа закрывает важный пробел между теоретическими возможностями LLM и практическими требованиями медицины. Переход к итеративному поиску улик снижает риск галлюцинаций, вызванных неполными данными, и делает ИИ-ассистентов более надежными инструментами поддержки врачебных решений. Использование верифицируемых наград (Verifiable Rewards) позволяет объективно оценивать качество рассуждений модели, а не только лингвистическую грамотность ответов.

Источник: arXiv cs.AI ↗