Исследования24 июля 2026 г., 07:17 МСК🤖 Auto

Водяные знаки в медицине: LLM теряют точность и галлюцинируют

Исследование ETH Zurich показало, что внедрение водяных знаков в LLM для отслеживания генерации текста критически снижает качество медицинских выводов, вызывая лексические искажения и галлюцинации.

Баннер новости 4265

Проблема домена: почему общие бенчмарки не работают

Крупные языковые модели (LLM) все чаще интегрируются в клинические рабочие процессы, что требует надежной трассируемости сгенерированного вывода. Для этого используются алгоритмы водяных знаков (watermarking). Однако большинство существующих оценок опираются на общие бенчмарки, игнорируя специфику медицины. В этой области даже незначительные изменения на уровне токенов, вызванные алгоритмом маркировки, могут привести к существенным семантическим искажениям, опасным для пациентов.

Масштаб исследования: 11 LLM, 7 VLM и валидация экспертами

Авторы работы (Melanie Rieff, Robin Staab, Thibaud Gloaguen, Stefan Hegselmann, Martin Vechev из ETH Zurich) провели первое строгое исследование влияния водяных знаков на медицинские показатели. Были протестированы 5 схем водяных знаков на базе 11 LLM и 7 мультимодальных моделей (VLM). Оценка проводилась по задачам уни- и мультимодального клинического рассуждения. Ключевым отличием стало использование конвейера, валидированного медицинскими экспертами, для систематического аудита качества рассуждений, терминологической точности и выявленных галлюцинаций.

Ключевые метрики и выявленные сбои

Результаты показали, что водяные знаки вызывают существенную деградацию по нескольким направлениям. Алгоритмы маркировки приводят к «лексической коррупции» (искажению медицинских терминов), появлению вымышленной терминологии (галлюцинациям) и усилению ошибок при интерпретации медицинских изображений (пропуск или неверная атрибуция находок). Отсутствие доменно-специфического анализа, combined с агрегированными метриками, которые не фиксируют клинически значимые ошибки, систематически скрывает реальные риски внедрения таких моделей.

Сравнение эффективности схем маркировки

В исследовании оценивались различные подходы к внедрению водяных знаков. Ниже приведена сводка по типам схем, протестированным в работе, и их общему влиянию на клиническую точность:

Тип схемы водяных знаков Механизм действия Влияние на медицинскую точность
Статистическое смещение токенов Изменение вероятности выбора токенов на основе секретного ключа Высокий риск лексических искажений и потери семантики
Синтаксические маркеры Внедрение скрытых паттернов в структуру предложения Нарушение клинической логики и связности текста
Мультимодальные маркеры Кодирование данных в визуальных и текстовых выходах VLM Усиление ошибок интерпретации медицинских изображений

Вывод: доменная специфика как prerequisite

Авторы подчеркивают, что текущие бенчмарки могут маскировать клинически значимые сбои, вызванные водяными знаками. Для безопасного развертывания LLM в медицине необходимо внедрение доменно-специфических оценок, которые учитывают не только общую языковую точность, но и терминологическую строгость, а также безопасность клинических рекомендаций. Игнорирование этих факторов ставит под угрозу доверие к ИИ-ассистентам в здравоохранении.

Источник: arXiv cs.AI ↗