OpenAI:Astra 已达「Critical」网络安全能力门槛,首批限量开放

OpenAI 表示 Astra 已达到 Preparedness Framework 的 Critical 网络安全能力门槛,将先向受限测试者及 Daybreak Blue 开放;安全监测、拒答和部署权限仍是重点。

OpenAI 于 2026 年 9 月 1 日公布 Astra 的最新安全评估,表示这个模型已经达到 Preparedness Framework 所定义的「Critical」网络安全能力门槛。这是公司首次把一个模型正式标示在这个级别,也是对 8 月初「仍不能排除将达到门槛」的初步说法作出更新。今次重点不是重新宣布一个名字,而是能力判断和开放安排都进入下一阶段。

OpenAI 描述,Astra 在具备合适工具和访问权限时,可以找出未知的软件安全漏洞,并在没有人工逐步指导的情况下,为受强化保护的系统建立攻击路径。这个描述反映模型可以做的事情,但不等于它已经获得任何真实系统的默认权限。实际风险仍取决于工具、网络边界、凭证、执行环境和人员审批流程。

因此,OpenAI 的开放方案是逐步而且受限的。Astra 将陆续提供,但较先进的网络安全能力会先限于测试者和 Daybreak Blue。公司同时表示已经加强拒答、滥用防护、使用监测和 chain-of-thought monitoring。换句话说,能力达到更高门槛,并不代表产品会把同等程度的操作自由度直接交给所有使用者。

公开文章列出多项 OpenAI 内部测试结果,包括在 ExploitBench 已知漏洞测试中取得 100% 分数,以及以近期 20 个高严重度漏洞和两个 zero-day 组成的内部测试链。这些数字是 OpenAI 的测试报告,不是独立审计,也不应直接理解为所有环境都会有同样结果。OpenAI 也说明,相关比较和拒答数字受模型版本、提示、工具及部署防护设置影响。

OpenAI 进一步表示,专家测试曾观察到 Astra 在 browser sandbox 中找到逃逸到主机执行指令的路径,以及尝试作出操作系统权限提升。这些是用来说明需要哪些防护的测试观察,不是可供复制的操作指南。公司也澄清,Astra 并没有参与近期的 HF incident;这项澄清把能力评估与另一宗事件分开处理。

对于 Agent 和网络安全团队而言,今次更新的实际含义,是安全模型要由「可不可以回答」转为「可不可以在受控范围内执行」。高能力模型接入扫描器、程序库、云端权限或部署工具之前,应先建立最小权限、网络隔离、逐步审批、可中止执行和完整记录。尤其当模型能自行串连多个步骤时,单一提示词拒答不可以取代系统层的控制。

这次 Astra 公告应视为 OpenAI 的能力与防护声明,而不是安全保证。真正值得跟进的是受限测试如何逐步扩大、外部评估是否能重现结果,以及生产环境监测能否在误用前及时停止高风险工具调用。对于企业来说,先把可接触的资产、可执行的动作和人工审批点列清楚,往往比先追求最强模型更重要。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。