OpenAI 評估 Astra:初步結果已不能排除 critical cyber capability

OpenAI 表示,對即將推出的 Astra 進行內部評估後,模型在 agentic coding 和 cybersecurity 上的進步,已令公司不能排除 critical capability;公司同時收緊測試、網絡、工具和模型權重控制。

OpenAI 在 2026 年 8 月 7 日表示,最近幾天對即將推出的 Astra 進行的內部評估,顯示模型在 agentic coding 和 cybersecurity 方面有明顯進步。公司結合內部測試和專家評估後,認為目前不能排除 Astra 已達到 Preparedness Framework 所定義的 critical cybersecurity capability。

這個表述需要小心理解。OpenAI 並沒有宣布 Astra 已經確認達到 critical threshold,而是說 preliminary evaluations 顯示表現足以令公司不能排除這個可能性。Astra 仍是未發布模型,OpenAI 亦特別說明,它沒有參與早前 Hugging Face 事件中的 exploitation。

按照 OpenAI 的 Preparedness Framework,critical cybersecurity threshold 不是一般的程式編寫能力。門檻包括模型可以在沒有人工介入的情況下,於多個經強化的真實關鍵系統中找出並開發各種嚴重程度的 functional zero-day exploits,或者只根據高層次目標,制定及執行針對 hardened targets 的新型端到端 cyberattack strategy。

這也解釋了為甚麼 OpenAI 把 agentic coding 和 cybersecurity 放在一起看。模型如果可以長時間規劃、執行工具、處理程式碼和修正失敗,能力提升的不只是回答技術問題,而是將多個步驟串成可執行的行動。真正的風險取決於模型能力、可接觸的網絡和工具、隔離程度,以及監測系統能否在危險行動完成前中斷。

OpenAI 表示,已為較高能力的模型加強 security controls,包括 isolated testing environments、限制 network 和 tool access、模型權重保護及 encryption、額外 monitoring 和 detection,以及 sandboxed execution。對不符合新控制要求的 Astra 內部活動,公司會暫停執行。

另一項改動是對 Astra 的所有 agentic applications,包括 training 和 evaluation,實施 universal monitoring。OpenAI 表示,監測器會評估模型的 Chain of Thought,並在偵測到 high-risk activity 時觸發 security response,以便審查和中斷行動。這是公司公布的部署安排,並不代表外界已能獨立驗證監測器的有效性或誤報率。

這次更新的重點不在於替 Astra 提前貼上「已達標」標籤,而是顯示模型安全流程正在跟隨能力轉變。當模型開始接近可以獨立完成高風險 cyber workflow 的可能範圍,評估、權限、隔離、權重保護和第三方測試就不能再分開處理。OpenAI 表示會與政府機構及 selected AI safety organizations 合作測試,亦會向第三方 testing partners 提供較高風險評估的 security controls。

對使用者和企業而言,這個訊號代表「模型可以做到甚麼」與「模型獲准接觸甚麼」需要同時設計。更強的 cyber model 可以幫助 defender 更早發現漏洞,但若把它放在沒有網絡隔離、工具最小權限和人工審批的環境,測試能力本身也可能成為風險來源。這篇公告屬於 OpenAI 的 preliminary safety update,後續仍要看正式評估、外部測試和實際部署控制。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。