
NVIDIA 于 2026 年 9 月 28 日介绍 Open Agent Safety Platform,一套把 AI agent 的安全控制由 application layer 延伸到 runtime 和硬件的参考架构。它把 NVIDIA OpenShell 放在 Vera CPU 的 workload 旁边,再让 NVIDIA Sentry 在 BlueField-4 DPU 上做独立监控与 enforcement,目标是让 agent 即使偏离原本任务,也不能只靠自己决定下一步。
NVIDIA 提出五个设计原则:policy 要可验证、enforcement 要在 agent 之外、控制模型的路径、按可观察程度调整 agent 权限,以及由模型公司、企业和硬件供应商共同承担责任。这个方向与单纯把安全规则写入 system prompt 不同,因为主要控制点位于 agent 难以修改的 runtime 或 infrastructure 层。
架构分成三层。Application 包括模型、harness、工具和数据;runtime 将 workload 投射到工作站、edge 或 data center,并提供持续监控及 policy enforcement;infrastructure 则包括网络、数据库、文件系统、通用运算和安全监控硬件。OpenShell 负责 sandbox、身份、权限与政策,Sentry 则在 BlueField-4 上提供独立的 activity record 和即时控制。
NVIDIA 表示,OpenShell 可以把 agent 的 policy 转成可验证边界,管理它可以访问哪些文件、网络、工具、process 和 credential。Sentry 以 NVIDIA DOCA 将 agent interaction、policy decision、工具和数据访问串成 contextual record,协助检查 drift、追踪 delegated authority,及在需要时介入。这些是 NVIDIA 的架构主张,仍要以实际硬件、driver、身份系统和 policy 维护成本验证。
对于 Vera Rubin POD 的部署,NVIDIA 把 BlueField-4 放在 node 通往 model 的路径上,让它成为 agent 难以绕过的 out-of-band 观察点。文章也表示平台兼容其他硬件系统,但没有在这篇文章提供独立 benchmark 或完整的 production failure data;因此不应把 reference design 直接当成所有企业都能即时采用的产品方案。
这个方向的实际价值,在于把「agent 不应该做什么」变成可以测试、记录和阻止的 runtime policy。不过硬件监控不会自动解决错误 policy、过度授权、数据分类、供应链风险或人工审批问题。企业仍需要 threat model、最小权限、可回滚设计、audit retention 和 end-to-end 测试,并清楚定义谁可以修改或批准 policy。



