论文的主要研究对象是什么?
掩码扩散语言模型(dLLM)的服务系统,使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在单张 NVIDIA H200 GPU 上评测。
(翻译)服务掩码扩散大语言模型:基于真实硬件的特性分析与设计原则
Abstract page for arXiv paper 2608.23807: Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware
该论文在真实硬件(NVIDIA H200)上对掩码扩散语言模型的服务系统进行特征分析,发现请求难度呈离散分布,单个请求的 GPU 计算仅占墙钟时间的 24%,批处理可将吞吐量提升约 16 倍,并提出了固定填充同步批处理的批量超时规则。研究使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在 GSM8K 和 HumanEval 上完成评测。
掩码扩散语言模型(dLLM)的服务系统,使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在单张 NVIDIA H200 GPU 上评测。
仅约 24% 的墙钟时间是 GPU 计算,其余主要是 CPU 端的分发开销。
当批量大小为 16 时,相比逐请求分发基线,吞吐量提升约 16 倍,主要源于摊销 CPU 分发开销。