TensorRT Edge-LLM 在 MLPerf Edge Agentic 基准测试中的成绩如何?
在单台 Jetson AGX Thor 开发者套件上运行 Qwen3.6-27B,输出吞吐 52.33 tokens/s,完成全部 1,007 轮性能负载用时 24 分 36 秒,比 llama.cpp 参考提交的 2 小时 37 分钟快 6.4 倍。
(翻译)TensorRT Edge-LLM 在 Jetson AGX Thor 上以 6.4 倍速度完成 MLPerf Edge Agentic 基准测试

AI agents are moving from cloud data centers to vehicles, robots, and other edge devices. Unlike a chatbot that answers a single prompt, an agent works through…
NVIDIA 技术博客介绍 TensorRT Edge-LLM 在 MLPerf Inference v6.1 Edge Agentic 基准中的表现:在单台 Jetson AGX Thor 上运行 Qwen3.6-27B,输出吞吐 52.33 tokens/s,24 分 36 秒完成 1,007 轮负载,比 llama.cpp 参考提交快 6.4 倍。加速来自 NVFP4 量化、树状多 token 预测和 KV 缓存复用。
在单台 Jetson AGX Thor 开发者套件上运行 Qwen3.6-27B,输出吞吐 52.33 tokens/s,完成全部 1,007 轮性能负载用时 24 分 36 秒,比 llama.cpp 参考提交的 2 小时 37 分钟快 6.4 倍。
使用 NVFP4 量化降低权重和激活的显存占用,采用树状多 token 预测(MTP)减少目标模型生成步数,并通过 KV 缓存复用避免重复预填充长上下文。
使用 TensorRT Edge-LLM 的 release/0.9.1-mlpinf 分支,下载校准后的 Qwen3.6-27B NVFP4 checkpoint,按照 mlperf/README.md 构建 TensorRT 引擎,启动 OpenAI 兼容服务,再使用 MLCommons endpoint harness 运行配置。
让AI真正赋能企业(初探)
当年救了臭氧层的功臣,现在变成了永久性污染物
加密行业今年最重要的一天 可能就是明天
旧消费品,正长出新生意
月之暗面:网传创始人及员工信息系恶意造谣;OpenAI 放弃今年上市;iPhone Duo炒到9万,黄牛贷款欲囤货|AI周报
iOS 27 正式版体验:Siri AI 终于开窍了,老 iPhone 升级也有新东西被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」
飞书与豆包工作合体后首亮相:Agent 能进群,还能帮你写周报、做PPT
美国加密新规又黄了Build a serverless PII redaction pipeline with Amazon Bedrock Data Automation
OpenAI 总裁:AGI 已经发生
我和我的 AI 手机吃了 3 顿饭科学家演示水下太阳能电池
510万一张!携程上架太空旅行船票:已有681人购买,还得自己买保险;娃哈哈因拖欠员工公积金被查封办公楼;华为放权!问界将由赛力斯主导
从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海
开学季 | 学生理财的三条建议,学生党也可以一样理财
抖音上线 “免费短剧” App,短剧赛道再添一员猛将
OpenAI故意欠技术债,等Codex来还:仅2名工程师,把核心存储从Python重写成Rust无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA
场景越多 ≠ 产品越好,:从抽象价值到真实生活的定义结构58秒出杯,能拉花的咖啡机器人,在全球70国卖出600万杯
AI 写了几十页 PPT,“经营分析”报告仍被批不够深入?
百度做了一堆AI产品,却没有一个能代表百度?
AI攻克世纪数学难题,顶尖数学家抱团抵制,而他们担心的并不是丢了工作
HTTP 新增 QUERY 方法:有人叫好,也有人质疑“这不就是 GET?”支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎
做了两年AI落地,我总结了这7点思考
Meta 打造“组织第二大脑”智能体的设计思路
旗舰SoC进入融合计算时代,天玑9600 Pro首创AI原生架构!
实习生1天消耗1亿Token被约谈:如何衡量Token的ROI