NVIDIA Technical Blog 发布于 08/20 01:50

Building Federated Multimodal AI Workflows with NVIDIA FLARE

(翻译)使用 NVIDIA FLARE 构建联邦多模态 AI 工作流

查看原文

资讯摘要

Modern vision-language models (VLMs) can support tasks such as visual question answering, captioning, and image-text reasoning. In practice, however…

AI 摘要

本文介绍使用 NVIDIA FLARE 构建联邦多模态 AI 工作流,重点讨论跨机构训练视觉语言模型时的网络传输与聚合设计,包括大型对象外部化、张量流式传输和磁盘支撑聚合。还介绍了 FedUMM 在冻结的 BLIP3o 骨干上仅聚合 LoRA 适配器,将每轮通信量从 28.6GB 降至 0.094GB,并提升 VQA v2 0.7 分。

AI 问答

NVIDIA FLARE 如何降低联邦多模态训练中的通信和内存压力?

NVIDIA FLARE 支持大型对象外部化、张量流式传输和磁盘支撑聚合,从而减少序列化、传输和聚合时占用的内存。

FedUMM 的联邦训练方式是什么?

FedUMM 冻结 BLIP3o 多模态骨干,客户端只训练并上传 LoRA 适配器和对齐 token,服务器按模态聚合轻量更新。

FedUMM 在实验中取得了哪些结果?

在 8 客户端对比中,每轮通信量从 28.6GB 降至 0.094GB,VQA v2 提升 0.7 分,性能约为集中式参考的 97%。

打开原文