Исследования19 августа 2026 г., 07:18 МСК🤖 Auto

FedPref: Федеративное обучение для извлечения данных из рентгеновских отчетов

Исследователи представили FedPref — метод, позволяющий больницам совместно обучать модели Qwen3-8B для структурирования медицинских отчетов без обмена конфиденциальными данными пациентов.

Баннер новости 6043

Проблема неравномерных данных в радиологии

Радиологические отчеты содержат критически важную информацию в свободном тексте, но для поиска и анализа необходимы структурированные данные по фиксированной схеме. Главная проблема заключается в том, что аннотированные данные распределены неравномерно: крупные центры имеют много примеров, а небольшие больницы — мало. Объединение данных в централизованном хранилище часто невозможно из-за строгих норм конфиденциальности (HIPAA/GDPR).

Как работает FedPref

Авторы предлагают архитектуру FedPref, основанную на федеративном обучении с предпочтениями (Preference Learning). Процесс выглядит так:

  • Генерация гипотез: Замороженная публичная языковая модель предлагает альтернативные варианты извлечения данных в формате JSON.
  • Локальная оценка: Каждая больница ранжирует эти варианты на основе своих локальных аннотаций.
  • Обучение адаптеров: Узлы совместно обучают компактные адаптеры модели Qwen3-8B, обмениваясь только обновлениями весов, а не сырыми данными.
  • Гетерогенный учитель: Используется пул разных моделей для создания контрастных примеров, что предотвращает коллапс при повторении одних и тех же образцов.

Результаты на симуляции шести больниц

Эксперименты проводились на данных шести симулированных больниц с разным объемом данных и распространенностью заболеваний. Метод FedPref демонстрирует значительный прирост точности, особенно для сайтов с малым объемом данных:

Метрика Изолированное обучение FedPref Централизованное обучение (Pooled)
Client-mean F1 База +2.49 +2.66
Worst-site F1 База +9.10 Информация недостаточна
Gold Test Set F1 (400 отчетов) Информация недостаточна 68.68 71.67

Важно отметить, что FedPref сохраняет тот же порядок эффективности, что и централизованное обучение, но делает это без нарушения приватности. Разрыв в 3 F1-балла между FedPref и централизованным обучением (68.68 против 71.67) является приемлемой ценой за полную безопасность данных.

Значение для отрасли

Работа принята к публикации в ELAMI 2026 (в рамках конференции MICCAI 2026). Этот подход открывает путь к созданию коллаборативных ИИ-систем в медицине, где малые клиники могут получить доступ к качеству моделей уровня крупных центров, не рискуя утечкой данных пациентов.

Источник: arXiv cs.AI ↗