传统以太网为什么不适合AI训练场景?
AI训练流量低熵且同步性强,传统以太网的ECMP静态哈希会导致哈希冲突和链路不均衡,丢包与PFC暂停帧引发拥塞扩散,DCQCN等拥塞控制难以应对突发同步流量,且多租户隔离能力差,噪声流量可导致训练性能大幅下降。
(翻译)超大规模AI与以太网演进:Spectrum-X以太网如何改写规则

The massive growth of generative AI has fundamentally altered data center design. As distributed model training scales to span hundreds of thousands of GPUs…
本文介绍 NVIDIA Spectrum-X 以太网如何应对生成式 AI 时代超大规模训练对数据中心网络的压力。文章分析传统以太网在哈希冲突、拥塞控制与多租户隔离上的不足,阐述自适应路由、定向拥塞控制和 Multiplane 平面负载均衡等硬件加速机制,并引用 DeepSeek-V3 训练模拟证明其性能稳定。
AI训练流量低熵且同步性强,传统以太网的ECMP静态哈希会导致哈希冲突和链路不均衡,丢包与PFC暂停帧引发拥塞扩散,DCQCN等拥塞控制难以应对突发同步流量,且多租户隔离能力差,噪声流量可导致训练性能大幅下降。
通过SuperNIC中的硬件平面负载均衡器(PLB),动态监控每个物理平面的端到端拥塞状态,以两级层次化选择机制将数据包分发到最优平面,并在链路故障时自动切换,实现对整个Multiplane拓扑的高效利用和故障隔离。