
OpenAI 于 2026 年 7 月 15 日发布 GPT-Red 研究,介绍一个专门寻找模型弱点的自动化 red-teaming model。文章针对的问题很具体:当 AI 通过浏览器、连接的应用程序、本地文件或 code repository 接触第三方资料时,恶意指令可能混入工具返回内容,诱使系统泄露资料或执行不应该执行的动作。
OpenAI 认为,人工 red team 仍然是安全工作的重要部分,但设计和执行测试需要大量时间,难以产生足够多、足够分散的攻击样本。GPT-Red 的定位不是取代人,而是扩大可重复的攻击探索,让团队在部署前更快找到新的 failure mode。
GPT-Red 通过 self-play reinforcement learning 训练。模型和一组不同的 defender LLM 同时参与 red-teaming 情境:GPT-Red 以成功引发有效 failure 为目标,defender 则以抵抗攻击及完成原本任务为目标。当防守模型变得更稳健,攻击模型便需要寻找更强和更多样的方式。
这个模型会像人工 red team 一样,提出 prompt、观察 GPT 系列模型的回应,再按结果迭代。OpenAI 表示,GPT-Red 使用相当于公司部分大型 post-training run 的计算规模,而且把它直接加入 production model 的训练过程。按 OpenAI 的报告,GPT-5.6 Sol 在最困难的 direct prompt injection benchmark 上,失败次数比四个月前的最佳 production model 少 6 倍。
研究中的情境包括内部目录泄露、伪造付款指示、AWS credential 泄露、停用双重验证、上传 credential file、外部 script injection、转发 API key,以及恶意 build script。这些例子提醒团队,Prompt Injection 不只发生在聊天窗口,任何会把外部内容送入 Agent 上下文的工具都可能成为攻击面。
对于实际部署来说,GPT-Red 带出的重点是要把安全测试放入 workflow,而不是只在模型上线前做一次扫描。团队可以为不同工具建立 threat model,记录哪些资料由攻击者可控、哪些动作算作成功攻击,再把 automated red team、人工测试、第三方评估、分层 guardrails 和 real-time monitoring 一起使用。
这仍然是 OpenAI 对自家方法和结果的报告,不能直接视为所有 Agent 场景都会得到同样改善。真正可靠的安全基线,仍然需要在自己的工具、权限、数据和业务流程中重现测试,并保留人工作出高风险批准的控制点。



