
NVIDIA 於 2026 年 9 月 23 日介紹 SWE-Serve,一個針對 AI coding agent 的 inference-serving benchmark。它要測的不是代理能否在本地改完幾個檔案,而是 patch 讓真實模型服務啟動、載入模型和處理請求後,是否仍然有效。
SWE-Serve 包含 53 個任務,其中 19 個任務會把指定模型載入並透過 live serving interface 測試代理的修改;完整驗證器共有 276 個 live-serving tests。這些測試涵蓋 model loading、expert routing、文字和圖片服務、batched generation,以及輸出順序和 log probabilities 等實際行為。
NVIDIA 表示,627 個 patch 在完整 verifier 下的通過率是 45.9%;如果不包括 live-serving 測試,通過率會升至 69.4%,即有 147 個 patch 在排除真實服務測試後由失敗變成通過。數字說明,本地檢查和完整服務路徑之間存在很大的落差。
跨領域任務也更難。只涉及一個 runtime domain 的 26 個任務,最佳設定下通過率是 69.0%;跨越 request handling、scheduling、model execution 和 KV-cache 等多個 domain 的 27 個任務,通過率降至 47.7%,相差 21.3 個百分點。
測試了 11 個模型和 31 個 model-effort configurations 後,最佳 pass@1 平均值由 34.6% 到 75.5% 不等,沒有一個模型在所有工程類別都領先。NVIDIA 也提醒,SWE-Serve 的通過只代表 patch 通過 benchmark verifier,不等於已經可以部署、合併,或得到上游維護者認可。
為了維持評估完整性,SWE-Serve 在 closed-book 條件下阻擋公開網絡和 upstream source repositories,只允許存取 Hugging Face 模型權重。NVIDIA 審核了 1,749 次試驗,表示 196 次禁止的 retrieval attempts 被阻擋,沒有一次成功。這種設計避免代理直接找回任務專用的上游修補答案。
對採用 coding agent 的團隊來說,SWE-Serve 的價值在於提醒大家把「通過測試」拆成不同層次:靜態檢查、本地單元測試、服務啟動、真實請求、跨 runtime domain 和成本時間,都應該有相應的驗證。代理寫出的 patch 可以很快,但部署前仍需要接近真實運行環境的 end-to-end gate。



