Проблема домена: почему общие бенчмарки не работают
Крупные языковые модели (LLM) все чаще интегрируются в клинические рабочие процессы, что требует надежной трассируемости сгенерированного вывода. Для этого используются алгоритмы водяных знаков (watermarking). Однако большинство существующих оценок опираются на общие бенчмарки, игнорируя специфику медицины. В этой области даже незначительные изменения на уровне токенов, вызванные алгоритмом маркировки, могут привести к существенным семантическим искажениям, опасным для пациентов.
Масштаб исследования: 11 LLM, 7 VLM и валидация экспертами
Авторы работы (Melanie Rieff, Robin Staab, Thibaud Gloaguen, Stefan Hegselmann, Martin Vechev из ETH Zurich) провели первое строгое исследование влияния водяных знаков на медицинские показатели. Были протестированы 5 схем водяных знаков на базе 11 LLM и 7 мультимодальных моделей (VLM). Оценка проводилась по задачам уни- и мультимодального клинического рассуждения. Ключевым отличием стало использование конвейера, валидированного медицинскими экспертами, для систематического аудита качества рассуждений, терминологической точности и выявленных галлюцинаций.
Ключевые метрики и выявленные сбои
Результаты показали, что водяные знаки вызывают существенную деградацию по нескольким направлениям. Алгоритмы маркировки приводят к «лексической коррупции» (искажению медицинских терминов), появлению вымышленной терминологии (галлюцинациям) и усилению ошибок при интерпретации медицинских изображений (пропуск или неверная атрибуция находок). Отсутствие доменно-специфического анализа, combined с агрегированными метриками, которые не фиксируют клинически значимые ошибки, систематически скрывает реальные риски внедрения таких моделей.
Сравнение эффективности схем маркировки
В исследовании оценивались различные подходы к внедрению водяных знаков. Ниже приведена сводка по типам схем, протестированным в работе, и их общему влиянию на клиническую точность:
| Тип схемы водяных знаков | Механизм действия | Влияние на медицинскую точность |
|---|---|---|
| Статистическое смещение токенов | Изменение вероятности выбора токенов на основе секретного ключа | Высокий риск лексических искажений и потери семантики |
| Синтаксические маркеры | Внедрение скрытых паттернов в структуру предложения | Нарушение клинической логики и связности текста |
| Мультимодальные маркеры | Кодирование данных в визуальных и текстовых выходах VLM | Усиление ошибок интерпретации медицинских изображений |
Вывод: доменная специфика как prerequisite
Авторы подчеркивают, что текущие бенчмарки могут маскировать клинически значимые сбои, вызванные водяными знаками. Для безопасного развертывания LLM в медицине необходимо внедрение доменно-специфических оценок, которые учитывают не только общую языковую точность, но и терминологическую строгость, а также безопасность клинических рекомендаций. Игнорирование этих факторов ставит под угрозу доверие к ИИ-ассистентам в здравоохранении.
Источник: arXiv cs.AI ↗
