HSTU 生成式推荐模型在线上服务时面临什么挑战?
每请求都要处理很长的用户历史序列,需要在不重算全部键值状态的前提下实现低延迟推理。
(翻译)使用 NVIDIA Dynamo-Triton 部署 HSTU 生成式推荐系统

Generative recommender (GR) systems are emerging as a powerful new approach for large-scale personalization. Instead of treating recommendation as a set of…
英伟达技术博客介绍如何把 HSTU 生成式推荐模型从 PyTorch 开发迁移到生产推理:用 PyTorch AOTI 提前编译并导出模型,结合 FlexKV 支持的 KV 缓存与 NV Embedding Cache 降低显存占用和重复计算,再由 Dynamo-Triton 提供线上服务。在 RTX PRO 6000 Blackwell 上、100% GPU KV 缓存命中时,三层与八层 HSTU 模型延迟最高分别降低 4.47 倍和 5.93 倍。
每请求都要处理很长的用户历史序列,需要在不重算全部键值状态的前提下实现低延迟推理。
构建自定义算子与运行库、用 PyTorch AOTI 导出 HSTU 排序模型、启动 FlexKV 支撑的 KV 缓存服务、用原生 C++ 校验导出产物、最后用 Dynamo-Triton 提供推理服务。
在 RTX PRO 6000 Blackwell 工作站版 GPU、动态 batch size 8、GPU KV 缓存命中率 100% 的条件下,三层 HSTU 模型最高提速 4.47 倍,八层模型最高提速 5.93 倍。
巧合?Ledger 用户被盗9000万 经销商两个月前刚易主用AI降低激光焊使用门槛,这家公司完成数千万元融资|36氪首发旅行成为个人 Agent 的高频场景,「豆包工作」把几十小时攻略浓缩成 PPT
美债抛售红灯:期限溢价破十年高位 脱离美联储路径奈飞据悉正进行组织重组,预计将影响约5%的员工
大模型通用答案没有考虑每个人需求
24 天估值暴涨 37 倍,这就是 AI 圈年度爽文为什么 AI 产品需要体验评测
Telegram钱包全面开放 CFTC将事件合约纳入互换定义WorkBuddy国际版实测,双持打开新世界Let's Encrypt 从 2027 年起切换到有效期为 64 天的证书当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型独家丨阿维塔酝酿高层调整:董事长王辉已开始负责长安海外业务机构:预估2031年VCSEL市场需求量将有望达到6.5亿颗:fire::fire:开源接口平台v6.1发布,支持数据插件商务部欧洲司负责人解读中欧贸易投资磋商机制第二次例会成果Cloudflare 让决策模型打起了价格战:Clef 降价、提速、上多模态今年白云机场口岸出入境客货航班超10万架次,创历史同期新高商务部:中欧双方将继续探讨在世贸组织规则框架下,降低部分商品关税的可能性
Insights4vc:Rain 的 19.5 亿美元估值靠什么撑起
How Does Life Unfold? A Landscape Metaphor Comes Into Its Own.
Citrini:区块链终于迎来它的时刻 怎么选择投资组合深交所:9月28日至10月9日,共对141起证券异常交易行为采取了自律监管措施
华尔街新高藏隐忧多部门:汽车生产企业不得作虚假、夸大或引人误解的宣传人人皆可为师:全球首个物理AI数据众包服务平台“觅蜂派”正式发布澳门大学预计未来5年学生规模逾2.2万人
美债失控狂飙:冲击到底有多大?
什么样的代币化美股才是你需要的?人社部:将构建技能导向的薪酬分配制度,完善治理欠薪长效机制