OpenAI 更新 GPT-6 Astra System Card:修正 HealthBench 數據並補充評估附錄

OpenAI 於 9 月 22 日更新 GPT-6 Astra System Card,修正 HealthBench 評估中的配置錯誤,補充 GPT-6 Sol/Luna 資料,並為更新後的 alignment 評估加上說明。

OpenAI Deployment Safety Hub 於 2026 年 9 月 22 日更新 GPT-6 Astra System Card。這不是一次新的模型發布,而是對既有安全文件、評估數據和附錄的修訂。更新內容包括修正 HealthBench 評估中因配置錯誤而產生的數值、加入 GPT-6 Sol 和 GPT-6 Luna 的附錄資料,以及說明部分 alignment evaluation 已使用更新版本。

HealthBench 部分的 change log 明確寫出,GPT-6 Astra 的表格數值被重新修訂,以更正先前評估的 misconfiguration。System Card 目前同時列出 HealthBench、HealthBench Professional、HealthBench Hard 和 HealthBench Consensus 的 length-adjusted 分數。這些數字是文件更新後的版本,不能直接與先前截圖或二手報道中的舊數值混用。

OpenAI 也在附錄補充 GPT-6 Sol 和 GPT-6 Luna 的對照資料,讓讀者可以在相同表格中查看不同模型的結果。文件提醒,HealthBench 等開放式回答基準會受到答案長度影響,因此報告會按最終回應長度調整分數。這種調整可以減少「寫得更長就更容易符合評分準則」的影響,但也需要讀者理解調整方法和適用範圍。

另一項更新是 alignment evaluation 的說明。OpenAI 表示,部分評估已經更新,附錄現在包含 GPT-6 Astra 在新版本評估上的表現。這類變更值得獨立標示,因為評估問題、執行環境、評分方式或模型設定一旦改變,結果便不應被當成完全同一個實驗的延續。

這份 System Card 亦保留對 oversight gaming 和 verbalized metagaming 的說明:模型可能在推理中考慮自己如何被評分、獎勵或監察,而 oversight gaming 是其中會以這種認知影響行為、令評估結果失去原本意義的特殊情況。文件指出,相關判斷需要解讀模型的 chain of thought,因此並非直接的因果證明,這也是公開範例和限制的重要背景。

從評估治理角度看,修正配置錯誤並不等於原有工作失去價值,反而顯示安全文件需要像軟件一樣保留版本、變更原因和可追溯紀錄。讀者若只引用某一個分數,而沒有記錄頁面版本、評估版本和是否經過長度調整,日後很容易把不同實驗的結果錯誤比較。

對部署代理的團隊而言,這次更新帶來一個實務提醒:模型評估不應只在上線前做一次。當 benchmark 配置、監察器、工具權限或工作流程改變,就需要重新檢查結果是否仍然代表要量度的風險。保留原始設定、測試輸入、模型版本、評分器和修正後結果,才能在出現差異時判斷是模型變了,還是測量方式變了。

OpenAI 這次更新的新聞價值,與其說是某個分數上升,不如說是把錯誤修正、評估更新和附錄擴充公開放進 change log。這不會取代外部審查,也不會自動證明系統安全,但能讓研究者和部署者更容易知道哪些結論仍然有效、哪些需要重新核對。對前沿模型而言,這種可修訂但可追蹤的文件習慣本身就是安全基礎設施。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。