
Microsoft Research 在 2026 年 8 月 3 日發布 Orchard,一個面向可擴展 agentic AI research 的開放式框架。它的重點不是再加一層 agent orchestration,而是把 agent 所需要的環境、sandbox、訓練資料和評測流程抽出來,做成可以跨任務重用的基礎層。
Orchard 的核心元件是 Orchard Env。這是一個以 Kubernetes 為基礎的輕量環境服務,負責 sandbox lifecycle、command execution、file I/O、network policy、REST API 和 agent integration。它可以同時支援 software engineering、web navigation 和 personal assistant 等不同任務,不需要為每種 agent 重新建立整套執行環境。
這個設計解決了一個常被低估的問題:研究時使用的簡化 agent loop,未必等於實際部署時的 harness。Orchard 以 proxy 記錄真實 harness 的 model calls,再把每次 rollout 放進獨立 container,讓 agent 可以直接在 Codex、OpenClaw、ZeroClaw 或其他 harness 中訓練和評測。這樣做的價值,是減少「在簡化環境表現很好,換到真實工具鏈便失效」的落差。
Microsoft Research 同時發布 Orchard-SWE、Orchard-GUI 和 Orchard-Claw 三套 training recipes,以及相關 training data 和 evaluation methods。Orchard-SWE 聚焦 coding agent,Orchard-GUI 處理瀏覽器操作,Orchard-Claw 則面向電郵、日曆、搜尋和跨工具協調等個人助理工作。三者共用環境層,研究團隊便可以把同一套 sandbox 和資料管線延伸到不同領域。
官方報告的結果包括:Orchard-SWE 在 SWE-bench Verified 由 61.4% baseline 提升到 69.7%,配合 value-model reranking 後為 73%;Orchard-GUI 在 WebVoyager、Online-Mind2Web 和 DeepShop 的平均成功率為 68.4%;Orchard-Claw 在最多三次嘗試下於 Claw-Eval 完成 59.6% 任務,配合 ZeroClaw 後為 73.9%。這些數字是發布方在指定模型、harness、資料和評測設定下的結果,不應直接當成所有部署環境的保證。
Orchard 最值得留意的地方,是它把「agent 能力」和「agent 執行環境」分開。模型可以換,harness 可以換,任務和 evaluator 也可以換,但底層的 sandbox、資料收集和控制接口仍可重用。對研究團隊來說,這有助於重跑實驗;對工程團隊來說,則提醒大家評估長時間 agent 時,不能只看模型分數,還要測試工具權限、失敗恢復、網絡限制和日誌是否一致。
這仍然是一個研究與開源框架發布,不是即插即用的生產服務。採用前需要自行核對 Kubernetes 運維成本、環境隔離、資料來源、模型授權和 benchmark 是否貼近自己的工作。Orchard 的訊號在於,agent 基礎設施的競爭正由單一模型能力,轉向可重用、可觀察和能夠跨 harness 驗證的環境層。



