与 FIFO 相比,约束感知分配器在测试中最高将 GPU 利用率提升了多少?
在训练密集型场景中,利用率从 53.6% 提升到 87.0%,提升 33 个百分点。
(翻译)同一集群,利用率提升33个百分点:改变的是顺序

A Blog post by Dharma-AI on Hugging Face
本文介绍了一个约束感知的 GPU 分配器,并在相同硬件与工作负载下与 FIFO 调度器进行七场景基准测试。结果显示,GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。作者认为关键不是硬件,而是分配决策顺序:将实时推理需求视为动态曲线,并按优先级在全局时间范围内安排批处理作业。
在训练密集型场景中,利用率从 53.6% 提升到 87.0%,提升 33 个百分点。
它将实时推理需求视为随时间变化的曲线而非固定预留上限,在低谷期让批处理作业使用 GPU,并通过较高的实时需求未满足惩罚来保障可用性。
因为在 64 个 GPU、30 个任务的规模测试中,FIFO 与分配器的利用率和吞吐量相同,但分配器的优先级加权产出仍高出 15.9%。