AgentX基准是如何测试AI基础设施的?
AgentX通过AIPerf客户端逐轮回放预录的Claude Code会话,保留原始上下文长度、推理时间和工具调用延迟,并以不同并发度测量每兆瓦吞吐量与交互体验。
(翻译)NVIDIA Vera Rubin 与 Blackwell 为智能体 AI 每瓦性能树立新标准

AI agents have expanded inference from single-turn interactions into multi-step workflows that reason, invoke tools, coordinate subagents…
英伟达技术博客指出,AI智能体将推理从单轮扩展到多步骤工作流,单个智能体请求消耗约15倍于普通聊天的token。基于SemiAnalysis AgentX基准,Vera Rubin NVL72预览数据在每秒每用户160 token交互度下,比GB300 NVL72每兆瓦吞吐量最高提升30倍;GB300 NVL72相比H200 NVL8在DeepSeek V4 Pro和Kimi K3负载上分别最高提升15倍和80倍。
AgentX通过AIPerf客户端逐轮回放预录的Claude Code会话,保留原始上下文长度、推理时间和工具调用延迟,并以不同并发度测量每兆瓦吞吐量与交互体验。
在每秒每用户160 token的交互度下,Vera Rubin NVL72的AI工厂每兆瓦吞吐量比GB300 NVL72最高提升约30倍。