Проблема «бесконечного опроса» в ИИ-диагностике
Современные клинические ИИ-агенты (LLM-based agents) часто страдают от проблемы избыточных запросов: они могут бесконечно запрашивать новые анализы, не понимая, когда пора ставить диагноз или перенаправлять пациента врачу. Существующие бенчмарки оценивают точность после фиксированного числа взаимодействий, игнорируя надежность автономной остановки. Авторы работы Yuexin Wu и Vasile Rus предлагают решение — Cros (Risk-Constrained Stopping layer), который объединяет ранжирование ошибок по состояниям и строгие статистические тесты (LTT-style) для гарантии минимального покрытия и контроля ошибок.
Результаты на датасете MIMIC
Команда протестировала метод на выборке из 1 834 эпизодов, смоделированных на основе данных MIMIC (абдоминальная боль). Ключевое преимущество Cros — способность выбирать, когда не ставить диагноз, если уверенность недостаточна. Это позволяет снизить затраты и риск ошибки.
| Метрика | Cros (полный ранкер) | Native Stopping (базовая модель) |
|---|---|---|
| Выборочная ошибка (Selective Error) | 16.9% | 30.8% |
| Покрытие (Coverage) | 78.8% | 100% |
| Средняя стоимость (Cost) | 5.57 | 8.14 |
| Среднее число тестов | 0.68 | 1.53 |
| AUROC ошибки состояния | 0.853 | 0.715 (Max Prob) |
Как видно из таблицы, Cros позволяет достичь почти вдвое меньшей ошибки при отказе от 21.2% случаев (передавая их на ручной контроль), экономя ресурсы системы. Для сравнения, базовая модель с максимальной вероятностью класса показывает AUROC всего 0.715, а нативный скор остановки бэкбона — лишь 0.552.
Почему это важно для безопасности
Исследование подчеркивает критическую разницу между «исследовательской» и «подтверждающей» безопасностью. Хотя Cros демонстрирует отличные результаты на просмотренных данных, он удовлетворяет совместному критерию безопасности лишь в 6 из 20 респлитов разработки. Авторы честно отмечают: поскольку метки оценки использовались при разработке, это не является сертификатом безопасности, но служит важным аудиторским доказательством feasibility (жизнеспособности).
Кроме того, выявлен нелинейный эффект: принудительное продолжение диагностики (forced continuation) не всегда улучшает результат. Например, использование только анамнеза (HPI) дало ошибку 28.3%, а полный осмотр (full workup) — 34.3%, что доказывает вред избыточных вмешательств без четкого критерия остановки.
Источник: arXiv cs.AI ↗
