Проблема «слепой» оптимизации
В статье Clinical Reasoning Under a Partially Observed Objective (arXiv:2609.13238) исследователи из команды ODIN 2026 разобрали критический дефект в обучении медицинских NLP-моделей. При генерации отчетов по конусно-лучевой компьютерной томографии (CBCT) разработчики часто используют композитную цель, где 80% веса дает оценка фактической достоверности (через LLM), а 20% — лексическое совпадение (BLEU/METEOR). Однако во время разработки видна только та часть, что отвечает за лексику.
Результат: модель учится «угадывать» слова, игнорируя смысл. Преследование n-граммного совпадения снижает точность фактической валидности (entailment precision) с 0.522 до 0.266.
Эксперимент на 622 случаях
Авторы протестировали систему на публичном датасете, сравнив два подхода к выбору лучшего отчета. Использование только видимых лексических метрик привело к провалу, тогда как оптимизация по полной (включая скрытую LLM-часть) цели дала значительный прирост.
| Метрика / Показатель | Оптимизация по лексику (BLEU) | Композитная цель (LLM + Лексика) |
|---|---|---|
| Общий скор отчета | 0.2909 | 0.4122 |
| Точность фактов (Entailment Precision) | 0.266 | 0.522 |
| Площадь под кривой (AUC) для 985 утверждений | 0.486 (уровень случайности) | — |
Почему модель «врет»?
Ключевое открытие: модель не учится анализировать анатомию. Модель с 29 млн параметров, обученная на изображениях, показала AUC 0.486 — это статистически неотличимо от случайного угадывания. Напротив, заголовки файлов (metadata) предсказывали выбор предложений с AUC 0.718, а простая модель на признаках изображения — 0.663.
Это означает, что стандартные метрики поощряют не медицинский вывод, а соблюдение конвенций диктовки (например, упоминание центра сканирования). Модель просто копирует шаблоны, а не reasoning.
Решение: Гибридный генератор
Авторы представили систему, которая генерирует отчеты, опираясь на жесткие ограничения:
- 8 безусловных утверждений.
- 5 утверждений, зависящих от геометрии (полярность, сторона, уровень зуба).
На 50 тестовых случаях из невидимого центра (unseen centre) система достигла METEOR 0.3542, доказав, что учет клинического контекста важнее простого совпадения слов.
Источник: arXiv cs.CL ↗
