
DeepSeek 于 2026 年 7 月 31 日更新 API changelog,宣布 DeepSeek-V4-Flash-0731 的官方 API 版本进入 public beta。对开发团队来说,这次更新的重点不是重新学习一套 API,而是可以保留原有调用方法,只把 model 名称改为 deepseek-v4-flash,便使用最新版本。
DeepSeek 表示,新版本的 Agent 能力明显提升,并列出一组由官方提供的 benchmark 结果:Terminal Bench 2.1 为 82.7、NL2Repo 为 54.2、Cybergym 为 76.7、DeepSWE 为 54.4,Toolathlon verified 为 70.3;另外 Agent Last Exam 为 25.2、Automation Bench Public 为 25.1、DSBench-FullStack 为 68.7、DSBench-Hard 为 59.6。
这些数字值得关注,但不应直接当成跨模型的独立结论。DeepSeek 表示,公开 Code Agent benchmark 使用即将推出的 DeepSeek Harness minimal mode,测试设置包括 max effort、top-p 0.95 及 temperature 1.0;DSBench-FullStack 和 DSBench-Hard 则是内部测试集。评测结果因此同时反映模型、Harness、工具配置和测试集,部署团队应先重跑自己最关心的任务,而不是只比较一张分数表。
在集成层面,官方表示 V4-Flash 原生支持 Responses API,并特别为 Codex 作出适配。DeepSeek-V4-Flash-0731 保持与 V4-Flash-Preview 相同的模型架构和大小,主要是重新进行 post-training;这次更新只升级 DeepSeek-V4-Flash API,V4-Pro API 以及 App / Web 使用的模型不变,V4-Pro 的正式版本则会稍后推出。
这个安排把「模型升级」和「产品升级」清楚分开。API 用户可以较容易切换 model identifier,但仍要验证 tool call schema、长任务的失败恢复、输出稳定性、延迟、限流、成本和日志记录。Agent 能力改善不等于整条 workflow 已经可靠,尤其当任务会写入代码、调用外部工具或修改数据时,权限与人工批准仍然是必要的控制点。
对采用者来说,最实际的做法是把模型名称、Harness 版本和工具权限一同记录,为关键流程保留一组可重跑的回归测试,再以 public beta 的实际可用性来决定是否扩大流量。DeepSeek 这次更新显示,Agent 模型竞争已不只看单一推理分数,也要看 API、Responses API、工具链和生产监控能否连成一个可管理的系统。



