
SpaceXAI 于 2026 年 7 月 16 日推出 Grok 4.5,定位是处理 coding、Agentic task 和 knowledge work 的新模型。这次发布的重点不只在模型本身,而是把模型放进能够完成多步骤工作、使用工具和产出文档的产品环境。
SpaceXAI 表示,Grok 4.5 的训练数据涵盖 coding、science、engineering 和 mathematics,并以数十万个任务进行 reinforcement learning,集中处理多步骤软件工程和其他技术工作。官方也表示,Agentic rollout 可以在异步训练流程中运行数小时,训练规模涉及数以万计的 NVIDIA GB300 GPU。
发布页列出多项官方 benchmark 结果,包括 Terminal Bench 2.1 的 83.3% 和 SWE-bench Pro 的 64.7%。SpaceXAI 又称,Grok 4.5 在 SWE-bench Pro 每个任务平均输出 15,954 个 token,对比页面列出的 Opus 4.8 约 67,020 个 token,约少 4.2 倍。这些数字来自 SpaceXAI 的发布页,部分比较结果引用其他开发者的 system card 或 benchmark leaderboard,应视为供应商公布的测试结果,而不是独立重测结论。
模型同时成为 Grok Build 的默认模型。SpaceXAI 展示的用途包括由一句指令建立完整应用程序、进行网上研究后制作 Excel 模型,以及在 PowerPoint 和 Word 里使用原生形状建立演示文稿和文档。Grok 4.5 也可在 Cursor 和 SpaceXAI API 使用,官方列出的 API 价格是每百万个 input token 2 美元、output token 6 美元。
对于 Agent 工作流来说,这次发布反映的变化是“模型能力”和“执行环境”开始绑定在一起。模型能否写 code 只是第一步,真正影响交付结果的还包括工具权限、文件隔离、测试流程、回滚方式和人工审批。当模型可以直接建立文件、修改项目或产出办公文档时,权限和审计记录就不能留到最后才补上。
因此,Grok 4.5 的 benchmark 和 token 效率值得关注,但不应直接等同于每个团队都会得到相同成果。实际评估仍要用自己的 codebase、文档、工具和成功标准重跑,并将高风险操作维持在可审批的范围内。Agent 能够完成更多步骤,并不代表它可以跳过验证。



