Groq 3 LPX在100K上下文上的交互性如何?
第三方Artificial Analysis基准测试显示,在Gemma 4 31B模型上,Groq 3 LPX实现了每秒3,431个输出token,展现出领先的交互性。
(翻译)NVIDIA Groq 3 LPX 如何在 NVIDIA Vera Rubin 上实现长上下文的超快交互

NVIDIA Groq 3 LPX is the interactive AI inference accelerator for the NVIDIA Vera Rubin platform. At the core of the platform is NVIDIA Vera Rubin NVL72…
NVIDIA技术博客介绍了Groq 3 LPX推理加速器,它与Vera Rubin NVL72平台结合,通过编译器调度、点对点C2C链路和细粒度计算通信重叠,降低首比特延迟,使模型能以每秒3000+ token的速度在100K上下文下运行。第三方Artificial Analysis基准显示,Gemma 4 31B模型在Groq 3 LPX上达到3,431 tokens/s输出,支持长上下文多轮智能体会话。
第三方Artificial Analysis基准测试显示,在Gemma 4 31B模型上,Groq 3 LPX实现了每秒3,431个输出token,展现出领先的交互性。
通过编译器调度的片间通信、点对点链路和细粒度计算-通信重叠等技术,将首比特延迟降至最低,从而在长上下文场景下保持高吞吐。