Google DeepMind Blog 发布于 06/11 00:24

DiffusionGemma: 4x faster text generation

(翻译)DiffusionGemma:文本生成速度最高提升4倍

查看原文

资讯摘要

An overview of DiffusionGemma, an exceptionally fast text generation model with up to 4x faster speeds.

AI 摘要

Google DeepMind 发布开源实验模型 DiffusionGemma,基于 26B 总参数 MoE 架构(激活 3.8B),采用文本扩散方式并行生成文本块,在 NVIDIA H100 上每秒可生成超 1000 个 token,较传统自回归模型最高提速 4 倍。模型以 Apache 2.0 协议开源,面向低并发、交互式本地推理场景,支持开发者微调。

AI 问答

DiffusionGemma 的生成速度有多快?

在 NVIDIA H100 上每秒可生成超过 1000 个 token,在 GeForce RTX 5090 上超过 700 个 token,相比传统自回归模型最高可提升 4 倍。

DiffusionGemma 的模型架构有什么特点?

它是一个 26B 总参数的 MoE 模型,推理时仅激活 3.8B 参数,采用文本扩散机制,每次前向传播可并行生成 256 个 token,并支持双向注意力。

该项目适合哪些应用场景?

适合速度敏感的交互式本地推理,如行内编辑、代码填充、数学图或氨基酸序列等非线性文本结构。高并发云服务场景下自回归模型可能更高效。

打开原文