arXiv cs.AI 发布于 08/26 12:00

Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

(翻译)服务掩码扩散大语言模型:基于真实硬件的特性分析与设计原则

查看原文

资讯摘要

Abstract page for arXiv paper 2608.23807: Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

AI 摘要

该论文在真实硬件(NVIDIA H200)上对掩码扩散语言模型的服务系统进行特征分析,发现请求难度呈离散分布,单个请求的 GPU 计算仅占墙钟时间的 24%,批处理可将吞吐量提升约 16 倍,并提出了固定填充同步批处理的批量超时规则。研究使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在 GSM8K 和 HumanEval 上完成评测。

AI 问答

论文的主要研究对象是什么?

掩码扩散语言模型(dLLM)的服务系统,使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在单张 NVIDIA H200 GPU 上评测。

单个请求中 GPU 计算时间占多少比例?

仅约 24% 的墙钟时间是 GPU 计算,其余主要是 CPU 端的分发开销。

批处理对吞吐量有什么影响?

当批量大小为 16 时,相比逐请求分发基线,吞吐量提升约 16 倍,主要源于摊销 CPU 分发开销。

打开原文