论文的主要研究对象是什么?
掩码扩散语言模型(dLLM)的服务系统,使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在单张 NVIDIA H200 GPU 上评测。
(翻译)服务掩码扩散大语言模型:基于真实硬件的特性分析与设计原则
Abstract page for arXiv paper 2608.23807: Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware
该论文在真实硬件(NVIDIA H200)上对掩码扩散语言模型的服务系统进行特征分析,发现请求难度呈离散分布,单个请求的 GPU 计算仅占墙钟时间的 24%,批处理可将吞吐量提升约 16 倍,并提出了固定填充同步批处理的批量超时规则。研究使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在 GSM8K 和 HumanEval 上完成评测。
掩码扩散语言模型(dLLM)的服务系统,使用 LLaDA-8B-Instruct 和 D2F LoRA 适配器,在单张 NVIDIA H200 GPU 上评测。
仅约 24% 的墙钟时间是 GPU 计算,其余主要是 CPU 端的分发开销。
当批量大小为 16 时,相比逐请求分发基线,吞吐量提升约 16 倍,主要源于摊销 CPU 分发开销。
Codex 和 Claude Code 都跑偏了,前 OpenAI 研究员称 Jev 出现前 AI 世界是个悲剧成年人要的「安心」,有时是一支笔给的
最大买家离场在即:ETH每天超 700 万美元抛压谁来接实测一个月,我把手机里 20 多个常用 App 全删了,只留了一个豆包工作未经批准含有“金融控股”等字样 三家企业被要求整改“太一量生”完成新一轮融资“双向奔赴”成亮眼风景线,A+H板块年内扩至209家App+1|专注星空:让「少刷手机」这件事更愉悦一点全国性涉外法律服务平台“法通”网正式上线:fire::fire:开源接口平台v6.1发布,支持数据插件七部门:推动电商领域高水平开放独家丨阿维塔酝酿高层调整:董事长王辉已开始负责长安海外业务
为什么 ChatGPT 总爱在标题里塞色情赌博小广告?得中女得天下?这个年销3亿的女装品牌AAAD给出了新答案!DjangoAdmin 敏捷开发框架 Flask+NaiveVue 版本 v2.8.2 发布葛洲坝航运扩能工程进入主体施工阶段人人皆可为师:全球首个物理AI数据众包服务平台“觅蜂派”正式发布奇瑞汽车旗下合肥智能科技公司增资至1.68亿,增幅1580%
谷歌Gemini 4新模型泄露 内测评价:这不Opus 5.5吗
24 天估值暴涨 37 倍,这就是 AI 圈年度爽文“物外智趣”完成数千万元人民币天使轮融资国旅文化投资集团增资至11.63亿元,增幅超130%Stripe创始人:AI agent 将重写整个互联网北京:增加人工智能手机和电脑、智能机器人等新一代智能终端产品有效供给德国央行官员:欧洲债务危机风险急剧上升奈飞据悉正进行组织重组,预计将影响约5%的员工腾讯入股墨奇智能