Исследования12 сентября 2026 г., 01:18 МСК🤖 Auto

Cros: Как ИИ-диагносты учатся вовремя останавливаться

Исследователи представили слой остановки Cros, который снижает риск ошибки диагностики на 45% за счет риск-ограниченного принятия решений в клинических агентах.

Баннер новости 7313

Проблема «бесконечного опроса» в ИИ-диагностике

Современные клинические ИИ-агенты (LLM-based agents) часто страдают от проблемы избыточных запросов: они могут бесконечно запрашивать новые анализы, не понимая, когда пора ставить диагноз или перенаправлять пациента врачу. Существующие бенчмарки оценивают точность после фиксированного числа взаимодействий, игнорируя надежность автономной остановки. Авторы работы Yuexin Wu и Vasile Rus предлагают решение — Cros (Risk-Constrained Stopping layer), который объединяет ранжирование ошибок по состояниям и строгие статистические тесты (LTT-style) для гарантии минимального покрытия и контроля ошибок.

Результаты на датасете MIMIC

Команда протестировала метод на выборке из 1 834 эпизодов, смоделированных на основе данных MIMIC (абдоминальная боль). Ключевое преимущество Cros — способность выбирать, когда не ставить диагноз, если уверенность недостаточна. Это позволяет снизить затраты и риск ошибки.

Метрика Cros (полный ранкер) Native Stopping (базовая модель)
Выборочная ошибка (Selective Error) 16.9% 30.8%
Покрытие (Coverage) 78.8% 100%
Средняя стоимость (Cost) 5.57 8.14
Среднее число тестов 0.68 1.53
AUROC ошибки состояния 0.853 0.715 (Max Prob)

Как видно из таблицы, Cros позволяет достичь почти вдвое меньшей ошибки при отказе от 21.2% случаев (передавая их на ручной контроль), экономя ресурсы системы. Для сравнения, базовая модель с максимальной вероятностью класса показывает AUROC всего 0.715, а нативный скор остановки бэкбона — лишь 0.552.

Почему это важно для безопасности

Исследование подчеркивает критическую разницу между «исследовательской» и «подтверждающей» безопасностью. Хотя Cros демонстрирует отличные результаты на просмотренных данных, он удовлетворяет совместному критерию безопасности лишь в 6 из 20 респлитов разработки. Авторы честно отмечают: поскольку метки оценки использовались при разработке, это не является сертификатом безопасности, но служит важным аудиторским доказательством feasibility (жизнеспособности).

Кроме того, выявлен нелинейный эффект: принудительное продолжение диагностики (forced continuation) не всегда улучшает результат. Например, использование только анамнеза (HPI) дало ошибку 28.3%, а полный осмотр (full workup) — 34.3%, что доказывает вред избыточных вмешательств без четкого критерия остановки.

Источник: arXiv cs.AI ↗