
Meta AI Research 于 2026 年 9 月 2 日发布 Muse Spark 1.3,并表示模型正在 Muse Code 和 Meta Model API 上线。这次升级没有只把焦点放在 benchmark,而是把较长时间的 Agent 工作、用户协作、工具调用和 coding usability 放在同一个发布内。先前可用的 reasoning modes 会先提供,max reasoning 则要等额外安全测试完成后才推出。
Muse Spark 1.3 的长流程设计,是让模型在面对开放式目标时自行用工具建立 context,整理混乱或互相矛盾的来源,主动修正计划缺口,再产出交付物。Meta 也表示模型会在 prompt 不清楚时提出澄清问题,遇到卡住时向用户求助,并在采取 consequential action 前确认。这几项行为比「会不会产生一段漂亮文字」更接近真实 Agent 的可靠性问题。
模型也针对长对话中的 multitasking 做调整。Meta 表示 Muse Spark 1.3 能更准确把新 prompt 对应到正确任务,即使用户在同一条 thread 中回看过去要求、插入新问题或改变方向。对于企业 workflow 而言,这有助减少任务串线;但生产环境仍应使用明确 task ID、状态和人工交接点,不能只依赖模型自行判断上下文。
Coding 是另一个主要卖点。Meta 表示,与 Muse Spark 1.2 比较,1.3 在内部 coding 评估中约少用 20% tool calls 和 25% tokens,同时减少不必要的 turns,并改善代码风格。这些数字来自 Meta 工程团队的比较,没有说明任务选择,也不是独立跨模型 benchmark。实际收益仍会受到 harness、repo 大小、工具延迟、上下文整理和 review 流程影响。
安全方面,Meta 表示 1.3 改善 adversarial robustness、prompt-injection resistance,以及对 irreversible action 的 calibration。模型也被训练去辨认自己的能力限制,在遇到障碍时承认问题而不是假装已经完成。这是良好的 Agent 行为方向,但「更懂得何时停止」要在实际工具、权限和恶意输入组合下测试,不能只由模型自述推断。
Meta 的发布节奏也透露产品分层。普通 reasoning modes 已可用,max reasoning 要等额外 safety testing;换句话说,最高能力不是与一般版本同一时间、无条件开放。对于需要自动写 code、改文件或操作外部工具的团队,应把不同 reasoning level 视为不同风险和成本配置,而不是同一个模型的外观选项。
对于企业采用者,Muse Spark 1.3 最值得试的不是一次性 demo,而是一条有明确成功条件的长流程。例如让 Agent 先读多个来源、建立工作计划、在每一步保留状态、遇到不确定性先询问,最后交由人员审核输出。测试时要同时记录完成率、错误工具调用、重复动作、用户介入次数及不可逆动作拦截。
目前最需要保持距离的是 Meta 对「personal superintelligence」、效率和 safety 的产品描述。Muse Spark 1.3 已经上线,不等于 max reasoning 已完成,也不等于所有 API 地区、账户和工具配置相同。采用前要以实际可用模型、限制、数据政策和自己的 Agent harness 做验证。



