NVIDIA FLARE 如何降低联邦多模态训练中的通信和内存压力?
NVIDIA FLARE 支持大型对象外部化、张量流式传输和磁盘支撑聚合,从而减少序列化、传输和聚合时占用的内存。
(翻译)使用 NVIDIA FLARE 构建联邦多模态 AI 工作流

Modern vision-language models (VLMs) can support tasks such as visual question answering, captioning, and image-text reasoning. In practice, however…
本文介绍使用 NVIDIA FLARE 构建联邦多模态 AI 工作流,重点讨论跨机构训练视觉语言模型时的网络传输与聚合设计,包括大型对象外部化、张量流式传输和磁盘支撑聚合。还介绍了 FedUMM 在冻结的 BLIP3o 骨干上仅聚合 LoRA 适配器,将每轮通信量从 28.6GB 降至 0.094GB,并提升 VQA v2 0.7 分。
NVIDIA FLARE 支持大型对象外部化、张量流式传输和磁盘支撑聚合,从而减少序列化、传输和聚合时占用的内存。
FedUMM 冻结 BLIP3o 多模态骨干,客户端只训练并上传 LoRA 适配器和对齐 token,服务器按模态聚合轻量更新。
在 8 客户端对比中,每轮通信量从 28.6GB 降至 0.094GB,VQA v2 提升 0.7 分,性能约为集中式参考的 97%。