Hugging Face Blog 发布于 08/18 03:46

Same Cluster, 33 Points More Utilization: What Changed Was the Order

(翻译)同一集群,利用率提升33个百分点:改变的是顺序

查看原文

资讯摘要

A Blog post by Dharma-AI on Hugging Face

AI 摘要

本文介绍了一个约束感知的 GPU 分配器,并在相同硬件与工作负载下与 FIFO 调度器进行七场景基准测试。结果显示,GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。作者认为关键不是硬件,而是分配决策顺序:将实时推理需求视为动态曲线,并按优先级在全局时间范围内安排批处理作业。

AI 问答

与 FIFO 相比,约束感知分配器在测试中最高将 GPU 利用率提升了多少?

在训练密集型场景中,利用率从 53.6% 提升到 87.0%,提升 33 个百分点。

分配器如何应对实时推理需求的波动?

它将实时推理需求视为随时间变化的曲线而非固定预留上限,在低谷期让批处理作业使用 GPU,并通过较高的实时需求未满足惩罚来保障可用性。

为什么作者认为仅看利用率不够?

因为在 64 个 GPU、30 个任务的规模测试中,FIFO 与分配器的利用率和吞吐量相同,但分配器的优先级加权产出仍高出 15.9%。

打开原文