AI Agent的安全控制应该放在哪一层?
NVIDIA认为,模型和harness属于行为控制,负责引导智能体的行动;而最终权威应属于安全运行时等基础设施层,由环境决定智能体实际能做什么,并强制执行策略、隔离和审计。
(翻译)安全在AI Agent技术栈中的位置

As AI agents become more capable and operate over longer horizons, building security and trust into the applications they power becomes increasingly important.
NVIDIA技术与安全团队发文阐述AI Agent技术栈中的安全定位。文章将智能体栈分为模型、harness、元harness、安全运行时(如OpenShell)和推理基础设施等层,强调行为控制与基础设施控制的分工:模型和harness引导行为,而运行时决定智能体实际能做什么。并提出检查每个效果、即时访问、隔离恢复等设计规则,以应对越权、凭证滥用、数据投毒等安全风险。
NVIDIA认为,模型和harness属于行为控制,负责引导智能体的行动;而最终权威应属于安全运行时等基础设施层,由环境决定智能体实际能做什么,并强制执行策略、隔离和审计。
五条规则包括:上层提议、下层决策;权威策略位置放在控制层之下;检查每个外部效果;采用即时访问的短时凭证;以及隔离和快速恢复。
OpenShell是安全运行时,提供隔离、身份、策略、凭据和审计,是Agent运行环境的权威执行层,确保上层组件无法绕过安全边界。