为什么分布式训练出现吞吐量下降时,GPU利用率和队列等待时间仍然正常?
文章指出这可能是链路级重传导致单个rank停滞,在同步集合通信(如NCCL all-reduce)中其他rank阻塞,形成级联故障,需要全栈可观测性来发现灰故障。
(翻译)如何为NVIDIA AI工厂选择全栈可观测性

AI infrastructure spans multiple layers, from compute and networking to storage, orchestration, and applications. When performance degrades…
本文介绍NVIDIA AI工厂的全栈可观测性选型方法。作者提出先枚举平台、GPU、网络、集群等故障域,再将组件映射到DCGM、NVSM、UFM、NetQ等遥测工具,以最少工具覆盖关键告警。文章以InfiniBand集群为例,演示如何用IPMI、DCGM、NVSM、UFM和BCM构建面向SLO的告警集,并统一到Prometheus/Grafana排障看板,避免告警疲劳。
文章指出这可能是链路级重传导致单个rank停滞,在同步集合通信(如NCCL all-reduce)中其他rank阻塞,形成级联故障,需要全栈可观测性来发现灰故障。
先枚举故障域,再根据组件到遥测源的决策框架选择最小工具集,例如GPU用DCGM、InfiniBand用UFM、集群用BCM,并统一到Prometheus/Grafana。