Исследования16 сентября 2026 г., 03:18 МСК🤖 Auto

Ловушка BLEU: почему метрики мешают ИИ писать точные мед. отчеты

Исследование показывает, что оптимизация по стандартным метрикам (BLEU/METEOR) снижает клиническую точность отчетов CBCT в 2 раза. Авторы предлагают гибридный подход с LLM-оценкой.

Баннер новости 7586

Проблема «слепой» оптимизации

В статье Clinical Reasoning Under a Partially Observed Objective (arXiv:2609.13238) исследователи из команды ODIN 2026 разобрали критический дефект в обучении медицинских NLP-моделей. При генерации отчетов по конусно-лучевой компьютерной томографии (CBCT) разработчики часто используют композитную цель, где 80% веса дает оценка фактической достоверности (через LLM), а 20% — лексическое совпадение (BLEU/METEOR). Однако во время разработки видна только та часть, что отвечает за лексику.

Результат: модель учится «угадывать» слова, игнорируя смысл. Преследование n-граммного совпадения снижает точность фактической валидности (entailment precision) с 0.522 до 0.266.

Эксперимент на 622 случаях

Авторы протестировали систему на публичном датасете, сравнив два подхода к выбору лучшего отчета. Использование только видимых лексических метрик привело к провалу, тогда как оптимизация по полной (включая скрытую LLM-часть) цели дала значительный прирост.

Метрика / Показатель Оптимизация по лексику (BLEU) Композитная цель (LLM + Лексика)
Общий скор отчета 0.2909 0.4122
Точность фактов (Entailment Precision) 0.266 0.522
Площадь под кривой (AUC) для 985 утверждений 0.486 (уровень случайности)

Почему модель «врет»?

Ключевое открытие: модель не учится анализировать анатомию. Модель с 29 млн параметров, обученная на изображениях, показала AUC 0.486 — это статистически неотличимо от случайного угадывания. Напротив, заголовки файлов (metadata) предсказывали выбор предложений с AUC 0.718, а простая модель на признаках изображения — 0.663.

Это означает, что стандартные метрики поощряют не медицинский вывод, а соблюдение конвенций диктовки (например, упоминание центра сканирования). Модель просто копирует шаблоны, а не reasoning.

Решение: Гибридный генератор

Авторы представили систему, которая генерирует отчеты, опираясь на жесткие ограничения:

  • 8 безусловных утверждений.
  • 5 утверждений, зависящих от геометрии (полярность, сторона, уровень зуба).

На 50 тестовых случаях из невидимого центра (unseen centre) система достигла METEOR 0.3542, доказав, что учет клинического контекста важнее простого совпадения слов.

Источник: arXiv cs.CL ↗