DeepSeek-V4-Flash-0731 開放 Public Beta:Agent 能力提升,但評測方法仍要拆開看

DeepSeek 將 V4-Flash-0731 API 開放 public beta,維持原有呼叫方式並加入 Responses API;官方 benchmark 顯示 Agent 能力提升,但部分測試依賴尚未公開的 Harness。

DeepSeek 在 2026 年 7 月 31 日更新 API changelog,宣布 DeepSeek-V4-Flash-0731 的官方 API 版本進入 public beta。對開發團隊來說,這次更新的重點不是重新學一套 API,而是可以保留原有呼叫方法,只把 model 名稱改為 deepseek-v4-flash,便使用最新版本。

DeepSeek 表示,新版本的 Agent 能力明顯提升,並列出一組由官方提供的 benchmark 結果:Terminal Bench 2.1 為 82.7、NL2Repo 為 54.2、Cybergym 為 76.7、DeepSWE 為 54.4,Toolathlon verified 為 70.3;另外 Agent Last Exam 為 25.2、Automation Bench Public 為 25.1、DSBench-FullStack 為 68.7、DSBench-Hard 為 59.6。

這些數字值得留意,但不應直接當成跨模型的獨立結論。DeepSeek 說,公開 Code Agent benchmark 使用即將推出的 DeepSeek Harness minimal mode,測試設定包括 max effort、top-p 0.95 及 temperature 1.0;DSBench-FullStack 和 DSBench-Hard 則是內部測試集。評測結果因此同時反映模型、Harness、工具配置和測試集,部署團隊應先重跑自己最關心的任務,而不是只比較一張分數表。

整合層面上,官方表示 V4-Flash 原生支援 Responses API,並特別為 Codex 作出適配。DeepSeek-V4-Flash-0731 保持與 V4-Flash-Preview 相同的模型架構和大小,主要是重新進行 post-training;今次更新只升級 DeepSeek-V4-Flash API,V4-Pro API 以及 App / Web 使用的模型不變,V4-Pro 的正式版本則會稍後推出。

這個安排把「模型升級」和「產品升級」清楚分開。API 用戶可以較容易切換 model identifier,但仍要驗證 tool call schema、長任務的失敗恢復、輸出穩定性、延遲、限流、成本和日誌記錄。Agent 能力改善不等於整條 workflow 已經可靠,尤其當任務會寫入程式碼、呼叫外部工具或修改資料時,權限與人工批准仍然是必要的控制點。

對採用者而言,最實際的做法是把模型名稱、Harness 版本和工具權限一同記錄,為關鍵流程保留一組可重跑的回歸測試,再以 public beta 的實際可用性來決定是否擴大流量。DeepSeek 這次更新顯示,Agent 模型競爭已不只看單一推理分數,也要看 API、Responses API、工具鏈和生產監控能否連成一個可管理的系統。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。