Проблема масштабирования VLM в федеративных сетях
Современные модели «визуальный язык» (VLM) требуют огромных объемов данных для дообучения. Однако в реальных сценариях (медицина, финансы) данные распределены между организациями, которые не могут централизовать сырые записи. Классический подход к федеративному обучению (FedAvg), предполагающий передачу полных весов модели, создает критические узкие места: огромная нагрузка на сеть и память сервера при агрегации обновлений от множества клиентов.
Решение: FedUMM и архитектура с замороженным бэкбонем
Команда разработала FedUMM (Federated Unified Multimodal Model), работающую на базе NVIDIA FLARE. Ключевая инновация заключается в том, что базовая модель BLIP3o остается замороженной (frozen) на всех клиентах. Локально обучаются только легкие LoRA-адаптеры (Low-Rank Adaptation). Сервер агрегирует только эти компактные обновления, а не всю модель.
Результаты бенчмарков: экономия трафика и точность
Эксперименты проводились на наборах данных VQA v2 (визуальный вопросно-ответный) и GenEval с гетерогенностью данных (Dirichlet-controlled) до 16 клиентов. Сравнение показывает радикальное снижение объема передаваемых данных при сохранении высокой точности.
| Метрика | Полное моделирование (Full-model FedAvg) | FedUMM (LoRA-адаптеры) |
|---|---|---|
| Объем данных на клиента за раунд | 28.6 GB | 0.094 GB |
| Снижение трафика | — | в ~304 раза |
| Точность VQA v2 (относительно централизованной) | ~97% | ~97% (+0.7 пп. к базовому FedAvg) |
| Точность GenEval (относительно централизованной) | ~97% | ~97% |
Технические механизмы NVIDIA FLARE для больших данных
Для поддержки как легких адаптеров, так и потенциального обучения полных моделей, NVIDIA FLARE внедрила три ключевых механизма оптимизации:
- Externalize large objects: Замена тяжелых объектов в сообщениях на легкие ссылки с отдельной передачей данных. Это позволяет обходить лимиты сериализации.
- Tensor Streaming (FLARE Tensor Downloader): Инкрементная передача тензоров чанками (pull-based protocol). Сервер не загружает всю модель в память сразу, а запрашивает только нужные куски, что снижает пиковое потребление RAM.
- Disk-backed aggregation (с версии 2.8.0): Агрегация обновлений происходит через временные файлы формата
safetensorsна диске, а не в оперативной памяти. Это предотвращает линейный рост потребления CPU-памяти сервера при увеличении числа клиентов.
Значение для индустрии
Проект FedUMM получил награду Outstanding Student Paper Award на воркшопе FL@FM в рамках TheWebConf 2026. Решение демонстрирует, что федеративное обучение сложных мультимодальных моделей становится технически и экономически целесообразным даже при ограниченных сетевых каналах, открывая путь к коллаборативному AI в регулируемых отраслях.
Источник: NVIDIA dev blog ↗
