OpenAI:Astra 已達「Critical」網絡安全能力門檻,首批受限開放

OpenAI 表示 Astra 已達 Preparedness Framework 的 Critical 網絡安全能力門檻,將先向受限測試者及 Daybreak Blue 開放;安全監測、拒答和部署權限仍是重點。

OpenAI 於 2026 年 9 月 1 日公布 Astra 的最新安全評估,表示這個模型已達到 Preparedness Framework 所定義的「Critical」網絡安全能力門檻。這是公司首次把一個模型正式標示在這個級別,亦是對 8 月初「仍不能排除將達到門檻」的初步說法作出更新。今次重點不是重新宣布一個名字,而是能力判斷和開放安排都進入下一階段。

OpenAI 描述,Astra 在具備合適工具和存取權限時,可以找出未知的軟件安全漏洞,並在沒有人工逐步指導的情況下,為受強化保護的系統建立攻擊路徑。這個描述反映模型能做的事情,但不等於它已獲得任何真實系統的預設權限。實際風險仍取決於工具、網絡邊界、憑證、執行環境和人員批准流程。

因此,OpenAI 的開放方案是逐步而且受限的。Astra 將陸續提供,但較先進的網絡安全能力會先限於測試者和 Daybreak Blue。公司同時表示已加強拒答、濫用防護、使用監測和 chain-of-thought monitoring。換句話說,能力到達更高門檻,並不代表產品會把同等程度的操作自由度直接交給所有使用者。

公開文章列出多項 OpenAI 內部測試結果,包括在 ExploitBench 已知漏洞測試中取得 100% 分數,以及以近期 20 個高嚴重度漏洞和兩個 zero-day 組成的內部測試鏈。這些數字是 OpenAI 的測試報告,不是獨立審計,也不應直接理解為所有環境都會有同樣結果。OpenAI 亦說明,相關比較和拒答數字受模型版本、提示、工具及部署防護設定影響。

OpenAI 進一步表示,專家測試曾觀察到 Astra 在 browser sandbox 中找到逃逸到主機執行指令的路徑,以及嘗試作出作業系統權限提升。這些是用來說明需要哪些防護的測試觀察,不是可供複製的操作指南。公司也澄清,Astra 並沒有參與近期的 HF incident;這項澄清把能力評估與另一宗事件分開處理。

對 Agent 和網絡安全團隊而言,今次更新的實際含義,是安全模型要由「可不可以回答」轉為「可不可以在受控範圍內執行」。高能力模型接入掃描器、程式庫、雲端權限或部署工具之前,應先建立最小權限、網絡隔離、逐步批准、可中止執行和完整記錄。尤其當模型能自行串連多個步驟時,單一提示詞拒答不可以取代系統層的控制。

這次 Astra 公告應視為 OpenAI 的能力與防護聲明,而不是安全保證。真正值得跟進的是受限測試如何逐步擴大、外部評估是否能重現結果,以及生產環境監測能否在誤用前及時停止高風險工具呼叫。對企業來說,先把可接觸的資產、可執行的動作和人工批准點列清楚,往往比先追求最強模型更重要。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。