
Anthropic 于 2026 年 9 月 29 日发布一份 Frontier Red Team 研究,评估由 Zhipu AI(海外品牌为 Z.ai)开发的 GLM-5.3。研究焦点不是一般聊天能力,而是模型能否在受控环境中协助完成较长的 cyber 任务,以及模型公开发布后,安全限制是否足以降低滥用风险。
Anthropic 的高层结论是,GLM-5.3 在其测试中已经跨过一个能力门槛:模型可以在自动化及 human-in-the-loop 工作流中处理端到端 exploit development 类型的任务,而它的 safeguard 也较容易被绕过或移除。这是 Anthropic 的 red-team 结果,不是独立重现或所有真实攻击的发生率;不同模型、工具、目标、权限和测试定义不能直接互相比较。
研究同时指出,开放权重会改变 threat model。用户可以在自己控制的环境中修改模型行为,模型供应商原本放在 API 层的拒绝政策就不再是唯一控制点。对企业和平台而言,这代表只检查模型名称或供应商声称的安全分数不足够,还要知道实际下载的是哪个权重版本、由谁部署、是否能连接外部网络,以及模型输出会否直接流入工具。
Anthropic 表示,测试在隔离或 sandbox 环境进行,涵盖 automated benchmark 和专家参与的研究流程。研究也承认 simulated environment 并不完美,不能直接等同于真实世界条件。为避免放大风险,本文不重现其 bypass 方法、exploit chain、漏洞编号或可直接执行的技术步骤,只保留对模型治理有用的高层观察。
这份报告的另一个讯息,是能力与安全未必会同步提升。模型可能在较少人手介入下找到复杂问题,但「能否完成」和「是否应该允许完成」是两个不同判断。对高影响 cyber 工作,安全边界需要位于 agent 之外,包括 sandbox、最小权限、网络出口控制、credential 隔离、完整 audit log 和人工 approval,而不是只依赖模型自己拒绝。
企业若要管理类似风险,可以先建立模型 provenance、权重变更、工具权限和 egress policy 的清单,再以离线 target、不可回连的测试环境和可回滚的 workflow 做验证。任何防御性自动化都应先由安全团队检查,并把 production secrets、真实客户资料和未授权目标完全排除在评估环境之外。
Anthropic 最后呼吁政府及模型开发者对足够强的 open-weight 模型进行安全测试。无论是否接受这个政策立场,GLM-5.3 个案都说明一件事:当前沿能力从受控 API 走向可下载权重,安全责任就由单一供应商延伸到模型发布、部署、工具链及使用者治理的整条链。



