
OpenAI 於 2026 年 7 月 15 日發布 GPT-Red 研究,介紹一個專門尋找模型弱點的自動化 red-teaming model。文章針對的問題很具體:當 AI 透過瀏覽器、連接的應用程式、本地文件或 code repository 接觸第三方資料時,惡意指令可能混入工具回傳內容,誘使系統外洩資料或執行不應該執行的動作。
OpenAI 認為,人工 red team 仍然是安全工作的重要部分,但設計和執行測試需要大量時間,難以產生足夠多、足夠分散的攻擊樣本。GPT-Red 的定位不是取代人,而是把可重複的攻擊探索擴大,讓團隊在部署前更快找到新的 failure mode。
GPT-Red 透過 self-play reinforcement learning 訓練。模型和一組不同的 defender LLM 同時參與 red-teaming 情境:GPT-Red 以成功引發有效 failure 為目標,defender 則以抵抗攻擊及完成原本任務為目標。當防守模型變得更穩健,攻擊模型便需要尋找更強和更多樣的方式。
這個模型會像人工 red team 一樣,提出 prompt、觀察 GPT 系列模型的回應,再按結果迭代。OpenAI 表示,GPT-Red 使用相當於公司部分大型 post-training run 的計算規模,而且把它直接加入 production model 的訓練過程。按 OpenAI 的報告,GPT-5.6 Sol 在最困難的 direct prompt injection benchmark 上,失敗次數比四個月前的最佳 production model 少 6 倍。
研究中的情境包括內部目錄外洩、偽造付款指示、AWS credential 外洩、停用雙重驗證、上載 credential file、外部 script injection、轉發 API key,以及惡意 build script。這些例子提醒團隊,Prompt Injection 不只發生在聊天視窗,任何會把外部內容送入 Agent 上下文的工具都可能成為攻擊面。
對實際部署而言,GPT-Red 帶出的重點是要把安全測試放入 workflow,而不是只在模型上線前做一次掃描。團隊可以為不同工具建立 threat model,記錄哪些資料由攻擊者可控、哪些動作算作成功攻擊,再把 automated red team、人工測試、第三方評估、分層 guardrails 和 real-time monitoring 一起使用。
這仍然是 OpenAI 對自家方法和結果的報告,不能直接視為所有 Agent 場景都會得到同樣改善。真正可靠的安全基線,仍然需要在自己的工具、權限、資料和業務流程中重現測試,並保留人工作出高風險批准的控制點。



