Исследования19 августа 2026 г., 11:19 МСК🤖 Auto

LLM-деидентификация: LLMы нашли PHI, которые пропустили золотые стандарты

Исследование Texas Children's Hospital показало, что правильно настроенные LLMы превосходят специализированные системы (TiDE, OpenMed) в обнаружении локальных медицинских данных, восстанавливая 227 пропущенных сущностей.

Проблема «слепых зон» в деидентификации

Вторичное использование электронных медицинских карт (EHR) требует строгой деидентификации. Однако существующие системы часто пропускают institutionally situated (институционально обусловленные) защищенные медицинские данные (PHI): внутренние коды, аббревиатуры больниц, названия зданий. Эти данные имеют локальный статус и отсутствуют в общих наборах данных, что делает их невидимыми для стандартных алгоритмов и даже для «золотых стандартов» аннотации.

Методология: 100 записей, 8 моделей, 3 уровня промптов

Команда исследователей из Texas Children's Hospital провела бенчмарк на 100 аннотированных педиатрических онкологических записях, содержащих 5 322 сущности PHI. Были протестированы:

  • 8 LLM с использованием in-context learning (ICL).
  • 2 специализированные системы: Stanford TiDE и OpenMed PII.
  • 2 паттерн-базовых метода.

Каждая LLM запускалась с тремя типами промптов: базовым (HIPAA), уточненным (с добавлением пропущенных категорий) и финальным (с запретом на избыточное удаление клинического контента).

Результаты: LLMы бьют специализированные системы

Лучшая конфигурация LLM показала F1-оценку 0.918 ± 0.001, значительно превзойдя Stanford TiDE (F1=0.779). Главное преимущество LLM — в контекстуальных категориях. Называние пропущенных категорий в промпте позволило восстановить 79% (48 из 61) таких сущностей.

Интересный факт: сложные многоагентные архитектуры (multi-agent) не превзошли калиброванное однократное промптирование (F1 0.906–0.907). Однако анализ ошибок LLM выявил 414 кандидатов на аннотационные пробелы, из которых 227 были подтверждены как реальные PHI. На этом финальном наборе данных модель достигла Recall=0.981.

Метод / Модель F1 Score Примечание
Best LLM (Calibrated ICL) 0.918 ± 0.001 Лучший результат, высокая точность в контекстных категориях
Stanford TiDE 0.779 Специализированная система, уступает LLM
OpenMed PII Информация недостаточна Уступает лучшим LLM
Multi-agent / Ensemble 0.906–0.907 Не превзошло однократное промптирование

Почему это важно для индустрии

Исследование доказывает, что LLM — это не просто «альтернатива», а легитимный инструмент, способный аудировать сами эталонные стандарты. Хотя запуск LLM дороже традиционных методов, эта стоимость окупается возможностью обнаружения скрытых PHI, которые ранее считались «чистыми». Стратегия institution-specific prompting становится ключевым методом адаптации деидентификации под конкретные клиники.

Источник: arXiv cs.CL ↗