
Microsoft Research 于 2026 年 8 月 3 日发布 Orchard,一个面向可扩展 agentic AI research 的开放式框架。它的重点不是再增加一层 agent orchestration,而是把 agent 所需要的环境、sandbox、训练资料和评测流程抽出来,做成可以跨任务复用的基础层。
Orchard 的核心组件是 Orchard Env。这是一个以 Kubernetes 为基础的轻量环境服务,负责 sandbox lifecycle、command execution、file I/O、network policy、REST API 和 agent integration。它可以同时支持 software engineering、web navigation 和 personal assistant 等不同任务,不需要为每种 agent 重新建立整套执行环境。
这个设计解决了一个常被低估的问题:研究时使用的简化 agent loop,未必等于实际部署时的 harness。Orchard 以 proxy 记录真实 harness 的 model calls,再把每次 rollout 放进独立 container,让 agent 可以直接在 Codex、OpenClaw、ZeroClaw 或其他 harness 中训练和评测。这样做的价值,是减少「在简化环境表现很好,换到真实工具链便失效」的落差。
Microsoft Research 同时发布 Orchard-SWE、Orchard-GUI 和 Orchard-Claw 三套 training recipes,以及相关 training data 和 evaluation methods。Orchard-SWE 聚焦 coding agent,Orchard-GUI 处理浏览器操作,Orchard-Claw 则面向电邮、日历、搜索和跨工具协调等个人助理工作。三者共用环境层,研究团队便可以把同一套 sandbox 和资料管线延伸到不同领域。
官方报告的结果包括:Orchard-SWE 在 SWE-bench Verified 由 61.4% baseline 提升到 69.7%,配合 value-model reranking 后为 73%;Orchard-GUI 在 WebVoyager、Online-Mind2Web 和 DeepShop 的平均成功率为 68.4%;Orchard-Claw 在最多三次尝试下于 Claw-Eval 完成 59.6% 任务,配合 ZeroClaw 后为 73.9%。这些数字是发布方在指定模型、harness、资料和评测设定下的结果,不应直接当成所有部署环境的保证。
Orchard 最值得留意的地方,是它把「agent 能力」和「agent 执行环境」分开。模型可以换,harness 可以换,任务和 evaluator 也可以换,但底层的 sandbox、资料收集和控制接口仍可复用。对研究团队来说,这有助于重跑实验;对工程团队来说,则提醒大家评估长时间 agent 时,不能只看模型分数,还要测试工具权限、失败恢复、网络限制和日志是否一致。
这仍然是一个研究与开源框架发布,不是即插即用的生产服务。采用前需要自行核对 Kubernetes 运维成本、环境隔离、资料来源、模型授权和 benchmark 是否贴近自己的工作。Orchard 的讯号在于,agent 基础设施的竞争正由单一模型能力,转向可复用、可观察和能够跨 harness 验证的环境层。



