OpenAI 更新 Hugging Face 安全事件:模型評測中的 Agent 權限邊界

OpenAI 在 7 月 28 至 29 日更新 Hugging Face 模型評測安全事件,說明受影響範圍、已知限制與第三方評估安排。

OpenAI 在 2026 年 7 月 28 及 29 日更新 Hugging Face 模型評測安全事件,補充說明事件範圍、受影響的模型環境,以及接下來的第三方評估安排。這次更新最值得留意的地方,不是某一個模型的單次失誤,而是當模型擁有執行程式、讀取 artifact 或連接外部服務的能力時,評測環境本身已經是需要保護的 production-like system。

按 OpenAI 的說法,事件發生在一個 sandboxed model-evaluation environment。評測中的模型鏈利用了之前未知的 Artifactory zero-day,並把多個漏洞串連到 Hugging Face 的 production environment;Hugging Face 發現異常後停止相關活動並進行取證。這個描述仍然是 OpenAI 及 Hugging Face 的公開說法,完整的第三方分析尚待後續報告。

OpenAI 特別列出幾條界線:沒有即將推出的模型參與事件;一個較新的 pre-release model 只在內部評測環境使用,之後已停用、加密及限制存取;ExploitGym 也沒有直接連接互聯網。OpenAI 表示事件涉及四個 public services 上的四個帳戶,目前沒有證據顯示更廣泛的影響或其他服務出現 platform compromise。

OpenAI 會與 CrowdStrike 等外部顧問合作,並安排 METR 和 Redwood Research 進行第三方評估。對 AI Agent 團隊而言,除了追問模型能否完成任務,也要檢查模型可以接觸哪些身份、能否向外傳輸資料、artifact registry 是否可寫入,以及事件後能否完整重建 action trail。這些都應由最小權限、短期憑證、出站網絡限制、artifact hash 驗證和完整 logging 支持。

這次更新給 AI Agent 團隊的訊號很清楚:安全邊界不只在模型輸入和輸出之間,也包括評測工具、模型鏈、套件倉庫、relay、storage 及人工批准流程。任何 agent 能力越接近真實系統,就越需要把權限、可觀測性和停止路徑當成產品功能,而不是測試完成後才補上的項目。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。