Проблема неравномерных данных в радиологии
Радиологические отчеты содержат критически важную информацию в свободном тексте, но для поиска и анализа необходимы структурированные данные по фиксированной схеме. Главная проблема заключается в том, что аннотированные данные распределены неравномерно: крупные центры имеют много примеров, а небольшие больницы — мало. Объединение данных в централизованном хранилище часто невозможно из-за строгих норм конфиденциальности (HIPAA/GDPR).
Как работает FedPref
Авторы предлагают архитектуру FedPref, основанную на федеративном обучении с предпочтениями (Preference Learning). Процесс выглядит так:
- Генерация гипотез: Замороженная публичная языковая модель предлагает альтернативные варианты извлечения данных в формате JSON.
- Локальная оценка: Каждая больница ранжирует эти варианты на основе своих локальных аннотаций.
- Обучение адаптеров: Узлы совместно обучают компактные адаптеры модели Qwen3-8B, обмениваясь только обновлениями весов, а не сырыми данными.
- Гетерогенный учитель: Используется пул разных моделей для создания контрастных примеров, что предотвращает коллапс при повторении одних и тех же образцов.
Результаты на симуляции шести больниц
Эксперименты проводились на данных шести симулированных больниц с разным объемом данных и распространенностью заболеваний. Метод FedPref демонстрирует значительный прирост точности, особенно для сайтов с малым объемом данных:
| Метрика | Изолированное обучение | FedPref | Централизованное обучение (Pooled) |
|---|---|---|---|
| Client-mean F1 | База | +2.49 | +2.66 |
| Worst-site F1 | База | +9.10 | Информация недостаточна |
| Gold Test Set F1 (400 отчетов) | Информация недостаточна | 68.68 | 71.67 |
Важно отметить, что FedPref сохраняет тот же порядок эффективности, что и централизованное обучение, но делает это без нарушения приватности. Разрыв в 3 F1-балла между FedPref и централизованным обучением (68.68 против 71.67) является приемлемой ценой за полную безопасность данных.
Значение для отрасли
Работа принята к публикации в ELAMI 2026 (в рамках конференции MICCAI 2026). Этот подход открывает путь к созданию коллаборативных ИИ-систем в медицине, где малые клиники могут получить доступ к качеству моделей уровня крупных центров, не рискуя утечкой данных пациентов.
Источник: arXiv cs.AI ↗
