Инструменты19 августа 2026 г., 21:00 МСК🤖 Auto

FedUMM: как NVIDIA FLARE снизила трафик федеративного обучения с 28.6 до 0.094 ГБ

NVIDIA и Университет Уильяма и Мэри представили FedUMM — фреймворк для федеративного обучения мультимодальных моделей, который сокращает объем передаваемых данных в 300 раз за счет использования LoRA-адаптеров.

Баннер новости 6096

Проблема масштабирования VLM в федеративных сетях

Современные модели «визуальный язык» (VLM) требуют огромных объемов данных для дообучения. Однако в реальных сценариях (медицина, финансы) данные распределены между организациями, которые не могут централизовать сырые записи. Классический подход к федеративному обучению (FedAvg), предполагающий передачу полных весов модели, создает критические узкие места: огромная нагрузка на сеть и память сервера при агрегации обновлений от множества клиентов.

Решение: FedUMM и архитектура с замороженным бэкбонем

Команда разработала FedUMM (Federated Unified Multimodal Model), работающую на базе NVIDIA FLARE. Ключевая инновация заключается в том, что базовая модель BLIP3o остается замороженной (frozen) на всех клиентах. Локально обучаются только легкие LoRA-адаптеры (Low-Rank Adaptation). Сервер агрегирует только эти компактные обновления, а не всю модель.

Результаты бенчмарков: экономия трафика и точность

Эксперименты проводились на наборах данных VQA v2 (визуальный вопросно-ответный) и GenEval с гетерогенностью данных (Dirichlet-controlled) до 16 клиентов. Сравнение показывает радикальное снижение объема передаваемых данных при сохранении высокой точности.

Метрика Полное моделирование (Full-model FedAvg) FedUMM (LoRA-адаптеры)
Объем данных на клиента за раунд 28.6 GB 0.094 GB
Снижение трафика в ~304 раза
Точность VQA v2 (относительно централизованной) ~97% ~97% (+0.7 пп. к базовому FedAvg)
Точность GenEval (относительно централизованной) ~97% ~97%

Технические механизмы NVIDIA FLARE для больших данных

Для поддержки как легких адаптеров, так и потенциального обучения полных моделей, NVIDIA FLARE внедрила три ключевых механизма оптимизации:

  • Externalize large objects: Замена тяжелых объектов в сообщениях на легкие ссылки с отдельной передачей данных. Это позволяет обходить лимиты сериализации.
  • Tensor Streaming (FLARE Tensor Downloader): Инкрементная передача тензоров чанками (pull-based protocol). Сервер не загружает всю модель в память сразу, а запрашивает только нужные куски, что снижает пиковое потребление RAM.
  • Disk-backed aggregation (с версии 2.8.0): Агрегация обновлений происходит через временные файлы формата safetensors на диске, а не в оперативной памяти. Это предотвращает линейный рост потребления CPU-памяти сервера при увеличении числа клиентов.

Значение для индустрии

Проект FedUMM получил награду Outstanding Student Paper Award на воркшопе FL@FM в рамках TheWebConf 2026. Решение демонстрирует, что федеративное обучение сложных мультимодальных моделей становится технически и экономически целесообразным даже при ограниченных сетевых каналах, открывая путь к коллаборативному AI в регулируемых отраслях.

Источник: NVIDIA dev blog ↗