DiffusionGemma 的生成速度有多快?
在 NVIDIA H100 上每秒可生成超过 1000 个 token,在 GeForce RTX 5090 上超过 700 个 token,相比传统自回归模型最高可提升 4 倍。
(翻译)DiffusionGemma:文本生成速度最高提升4倍

An overview of DiffusionGemma, an exceptionally fast text generation model with up to 4x faster speeds.
Google DeepMind 发布开源实验模型 DiffusionGemma,基于 26B 总参数 MoE 架构(激活 3.8B),采用文本扩散方式并行生成文本块,在 NVIDIA H100 上每秒可生成超 1000 个 token,较传统自回归模型最高提速 4 倍。模型以 Apache 2.0 协议开源,面向低并发、交互式本地推理场景,支持开发者微调。
在 NVIDIA H100 上每秒可生成超过 1000 个 token,在 GeForce RTX 5090 上超过 700 个 token,相比传统自回归模型最高可提升 4 倍。
它是一个 26B 总参数的 MoE 模型,推理时仅激活 3.8B 参数,采用文本扩散机制,每次前向传播可并行生成 256 个 token,并支持双向注意力。
适合速度敏感的交互式本地推理,如行内编辑、代码填充、数学图或氨基酸序列等非线性文本结构。高并发云服务场景下自回归模型可能更高效。