OpenAI GPT-Red:用自我博弈扩大 Prompt Injection 安全测试

OpenAI 于 2026 年 7 月 15 日介绍 GPT-Red,自动化寻找 Prompt Injection 漏洞并用于对抗式训练 GPT-5.6,让安全测试可以随着模型能力扩大。

OpenAI 于 2026 年 7 月 15 日发布 GPT-Red 研究,介绍一个专门寻找模型弱点的自动化 red-teaming model。文章针对的问题很具体:当 AI 通过浏览器、连接的应用程序、本地文件或 code repository 接触第三方资料时,恶意指令可能混入工具返回内容,诱使系统泄露资料或执行不应该执行的动作。

OpenAI 认为,人工 red team 仍然是安全工作的重要部分,但设计和执行测试需要大量时间,难以产生足够多、足够分散的攻击样本。GPT-Red 的定位不是取代人,而是扩大可重复的攻击探索,让团队在部署前更快找到新的 failure mode。

GPT-Red 通过 self-play reinforcement learning 训练。模型和一组不同的 defender LLM 同时参与 red-teaming 情境:GPT-Red 以成功引发有效 failure 为目标,defender 则以抵抗攻击及完成原本任务为目标。当防守模型变得更稳健,攻击模型便需要寻找更强和更多样的方式。

这个模型会像人工 red team 一样,提出 prompt、观察 GPT 系列模型的回应,再按结果迭代。OpenAI 表示,GPT-Red 使用相当于公司部分大型 post-training run 的计算规模,而且把它直接加入 production model 的训练过程。按 OpenAI 的报告,GPT-5.6 Sol 在最困难的 direct prompt injection benchmark 上,失败次数比四个月前的最佳 production model 少 6 倍。

研究中的情境包括内部目录泄露、伪造付款指示、AWS credential 泄露、停用双重验证、上传 credential file、外部 script injection、转发 API key,以及恶意 build script。这些例子提醒团队,Prompt Injection 不只发生在聊天窗口,任何会把外部内容送入 Agent 上下文的工具都可能成为攻击面。

对于实际部署来说,GPT-Red 带出的重点是要把安全测试放入 workflow,而不是只在模型上线前做一次扫描。团队可以为不同工具建立 threat model,记录哪些资料由攻击者可控、哪些动作算作成功攻击,再把 automated red team、人工测试、第三方评估、分层 guardrails 和 real-time monitoring 一起使用。

这仍然是 OpenAI 对自家方法和结果的报告,不能直接视为所有 Agent 场景都会得到同样改善。真正可靠的安全基线,仍然需要在自己的工具、权限、数据和业务流程中重现测试,并保留人工作出高风险批准的控制点。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。