NVIDIA Technical Blog 发布于 08/24 23:00

How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context on NVIDIA Vera Rubin

(翻译)NVIDIA Groq 3 LPX 如何在 NVIDIA Vera Rubin 上实现长上下文的超快交互

查看原文

资讯摘要

NVIDIA Groq 3 LPX is the interactive AI inference accelerator for the NVIDIA Vera Rubin platform. At the core of the platform is NVIDIA Vera Rubin NVL72…

AI 摘要

NVIDIA技术博客介绍了Groq 3 LPX推理加速器,它与Vera Rubin NVL72平台结合,通过编译器调度、点对点C2C链路和细粒度计算通信重叠,降低首比特延迟,使模型能以每秒3000+ token的速度在100K上下文下运行。第三方Artificial Analysis基准显示,Gemma 4 31B模型在Groq 3 LPX上达到3,431 tokens/s输出,支持长上下文多轮智能体会话。

AI 问答

Groq 3 LPX在100K上下文上的交互性如何?

第三方Artificial Analysis基准测试显示,在Gemma 4 31B模型上,Groq 3 LPX实现了每秒3,431个输出token,展现出领先的交互性。

Groq 3 LPX如何实现长上下文高交互性?

通过编译器调度的片间通信、点对点链路和细粒度计算-通信重叠等技术,将首比特延迟降至最低,从而在长上下文场景下保持高吞吐。

打开原文