NVIDIA Technical Blog 发布于 08/26 04:57

Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo

(翻译)借助 NVIDIA Dynamo 中的影子引擎恢复在数秒内恢复 LLM 推理容量

查看原文

资讯摘要

When an LLM engine process fails, the standard recovery path involves a cold restart. This requires loading weights into HBM from storage, compiling kernels…

AI 摘要

NVIDIA Dynamo 预览功能影子引擎恢复通过 GPU Memory Service 持久化权重并保留预初始化的空闲引擎,在故障时将 LLM 推理恢复从冷启动的 283 秒降至 7.3 秒。双引擎 GLM-5.2 测试中恢复速度提升约 39 倍,且重新初始化在后台进行,不影响服务路径。

AI 问答

影子引擎恢复如何做到秒级接管?

它让一个完全初始化的影子引擎与主引擎同卡驻留,通过 GPU Memory Service 共享 HBM 中的权重;主进程故障后,影子引擎只需获取锁、重新映射权重并物化 KV 缓存即可开始服务,无需冷启动加载权重和重建 CUDA graph。

影子引擎会额外占用多少显存?

停车状态下的影子引擎仅保留 CUDA 上下文、捕获的图、通信器和权重映射,不单独复制权重且不物化 KV 缓存,因此显存开销很小,可与活跃引擎同卡共存。

打开原文