NVIDIA SWE-Serve:AI coding agent 通过本地测试,未必能在真实模型服务中工作

NVIDIA 发布 SWE-Serve benchmark,以 53 个 inference-serving 任务测试 coding agent 的 patch;结果显示,排除 live-serving 测试会高估代理能否真正完成工作。

NVIDIA 于 2026 年 9 月 23 日介绍 SWE-Serve,一个针对 AI coding agent 的 inference-serving benchmark。它要测试的不是代理能否在本地改完几个文件,而是 patch 让真实模型服务启动、加载模型和处理请求后,是否仍然有效。

SWE-Serve 包含 53 个任务,其中 19 个任务会把指定模型加载并通过 live serving interface 测试代理的修改;完整验证器共有 276 个 live-serving tests。这些测试涵盖 model loading、expert routing、文本和图片服务、batched generation,以及输出顺序和 log probabilities 等实际行为。

NVIDIA 表示,627 个 patch 在完整 verifier 下的通过率是 45.9%;如果不包括 live-serving 测试,通过率会升至 69.4%,也就是有 147 个 patch 在排除真实服务测试后由失败变成通过。数字说明,本地检查和完整服务路径之间存在很大的落差。

跨领域任务也更难。只涉及一个 runtime domain 的 26 个任务,最佳设置下通过率是 69.0%;跨越 request handling、scheduling、model execution 和 KV-cache 等多个 domain 的 27 个任务,通过率降至 47.7%,相差 21.3 个百分点。

测试了 11 个模型和 31 个 model-effort configurations 后,最佳 pass@1 平均值由 34.6% 到 75.5% 不等,没有一个模型在所有工程类别都领先。NVIDIA 也提醒,SWE-Serve 的通过只代表 patch 通过 benchmark verifier,不等于已经可以部署、合并,或得到上游维护者认可。

为了维持评估完整性,SWE-Serve 在 closed-book 条件下阻挡公开网络和 upstream source repositories,只允许访问 Hugging Face 模型权重。NVIDIA 审核了 1,749 次试验,表示 196 次禁止的 retrieval attempts 被阻挡,没有一次成功。这种设计避免代理直接找回任务专用的上游修补答案。

对采用 coding agent 的团队来说,SWE-Serve 的价值在于提醒大家把「通过测试」拆成不同层次:静态检查、本地单元测试、服务启动、真实请求、跨 runtime domain 和成本时间,都应该有相应的验证。代理写出的 patch 可以很快,但部署前仍需要接近真实运行环境的 end-to-end gate。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。