影子引擎恢复如何做到秒级接管?
它让一个完全初始化的影子引擎与主引擎同卡驻留,通过 GPU Memory Service 共享 HBM 中的权重;主进程故障后,影子引擎只需获取锁、重新映射权重并物化 KV 缓存即可开始服务,无需冷启动加载权重和重建 CUDA graph。
(翻译)借助 NVIDIA Dynamo 中的影子引擎恢复在数秒内恢复 LLM 推理容量

When an LLM engine process fails, the standard recovery path involves a cold restart. This requires loading weights into HBM from storage, compiling kernels…
NVIDIA Dynamo 预览功能影子引擎恢复通过 GPU Memory Service 持久化权重并保留预初始化的空闲引擎,在故障时将 LLM 推理恢复从冷启动的 283 秒降至 7.3 秒。双引擎 GLM-5.2 测试中恢复速度提升约 39 倍,且重新初始化在后台进行,不影响服务路径。
它让一个完全初始化的影子引擎与主引擎同卡驻留,通过 GPU Memory Service 共享 HBM 中的权重;主进程故障后,影子引擎只需获取锁、重新映射权重并物化 KV 缓存即可开始服务,无需冷启动加载权重和重建 CUDA graph。
停车状态下的影子引擎仅保留 CUDA 上下文、捕获的图、通信器和权重映射,不单独复制权重且不物化 KV 缓存,因此显存开销很小,可与活跃引擎同卡共存。
Grayscale:低成本智能体AI将推高算力需求App+1|专注星空:让「少刷手机」这件事更愉悦一点
Kimi 现代高速开源治理的 AI Native 实践|QCon上海实测一个月,我把手机里 20 多个常用 App 全删了,只留了一个豆包工作中金黄金等在河南成立黄金投资公司,注册资本2000万元Zentrola 1.1.0 发布:应用接入、成本核算与月度 Token 配额七部门:推动电商平台规则向优转型分发与连接:抖音向左,美团向右,两种模式到底有什么差别财政部副部长廖岷会见高盛集团总裁温泽恩
「10.11大暴跌」一周年:加密市场发生了哪些变化?特斯拉FSD,在欧洲被打回原形
AI 落地,此刻发生 |1024 模力工场 AI 社区日,首批报名开启OPC企业容易陷入的三个增长误区
兰博基尼、保密协议 Ledger被盗事件疑点重重