影子引擎恢复如何做到秒级接管?
它让一个完全初始化的影子引擎与主引擎同卡驻留,通过 GPU Memory Service 共享 HBM 中的权重;主进程故障后,影子引擎只需获取锁、重新映射权重并物化 KV 缓存即可开始服务,无需冷启动加载权重和重建 CUDA graph。
(翻译)借助 NVIDIA Dynamo 中的影子引擎恢复在数秒内恢复 LLM 推理容量

When an LLM engine process fails, the standard recovery path involves a cold restart. This requires loading weights into HBM from storage, compiling kernels…
NVIDIA Dynamo 预览功能影子引擎恢复通过 GPU Memory Service 持久化权重并保留预初始化的空闲引擎,在故障时将 LLM 推理恢复从冷启动的 283 秒降至 7.3 秒。双引擎 GLM-5.2 测试中恢复速度提升约 39 倍,且重新初始化在后台进行,不影响服务路径。
它让一个完全初始化的影子引擎与主引擎同卡驻留,通过 GPU Memory Service 共享 HBM 中的权重;主进程故障后,影子引擎只需获取锁、重新映射权重并物化 KV 缓存即可开始服务,无需冷启动加载权重和重建 CUDA graph。
停车状态下的影子引擎仅保留 CUDA 上下文、捕获的图、通信器和权重映射,不单独复制权重且不物化 KV 缓存,因此显存开销很小,可与活跃引擎同卡共存。