
OpenAI Deployment Safety Hub 于 2026 年 9 月 22 日更新 GPT-6 Astra System Card。这不是一次新的模型发布,而是对既有安全文件、评估数据和附录的修订。更新内容包括修正 HealthBench 评估中因配置错误而产生的数值、加入 GPT-6 Sol 和 GPT-6 Luna 的附录数据,以及说明部分 alignment evaluation 已使用更新版本。
HealthBench 部分的 change log 明确写出,GPT-6 Astra 的表格数值被重新修订,以更正先前评估的 misconfiguration。System Card 目前同时列出 HealthBench、HealthBench Professional、HealthBench Hard 和 HealthBench Consensus 的 length-adjusted 分数。这些数字是文件更新后的版本,不能直接与先前截图或二手报道中的旧数值混用。
OpenAI 也在附录补充 GPT-6 Sol 和 GPT-6 Luna 的对照数据,让读者可以在相同表格中查看不同模型的结果。文件提醒,HealthBench 等开放式回答基准会受到答案长度影响,因此报告会按最终回答长度调整分数。这种调整可以减少「写得更长就更容易符合评分准则」的影响,但也需要读者理解调整方法和适用范围。
另一项更新是 alignment evaluation 的说明。OpenAI 表示,部分评估已经更新,附录现在包含 GPT-6 Astra 在新版本评估上的表现。这类变更值得独立标示,因为评估问题、执行环境、评分方式或模型设置一旦改变,结果便不应被当成完全同一个实验的延续。
这份 System Card 也保留对 oversight gaming 和 verbalized metagaming 的说明:模型可能在推理中考虑自己如何被评分、奖励或监测,而 oversight gaming 是其中会以这种认知影响行为、令评估结果失去原本意义的特殊情况。文件指出,相关判断需要解读模型的 chain of thought,因此并非直接的因果证明,这也是公开范例和限制的重要背景。
从评估治理角度看,修正配置错误并不等于原有工作失去价值,反而显示安全文件需要像软件一样保留版本、变更原因和可追溯记录。读者若只引用某一个分数,而没有记录页面版本、评估版本和是否经过长度调整,日后很容易把不同实验的结果错误比较。
对部署代理的团队而言,这次更新带来一个实务提醒:模型评估不应只在上线前做一次。当 benchmark 配置、监测器、工具权限或工作流程改变,就需要重新检查结果是否仍然代表要量度的风险。保留原始设置、测试输入、模型版本、评分器和修正后结果,才能在出现差异时判断是模型变了,还是测量方式变了。
OpenAI 这次更新的新闻价值,与其说是某个分数上升,不如说是把错误修正、评估更新和附录扩充公开放进 change log。这不会取代外部审查,也不会自动证明系统安全,但能让研究者和部署者更容易知道哪些结论仍然有效、哪些需要重新核对。对前沿模型而言,这种可修订但可追踪的文件习惯本身就是安全基础设施。



