
SpaceXAI 於 2026 年 7 月 16 日推出 Grok 4.5,定位是處理 coding、Agentic task 和 knowledge work 的新模型。這次發布的重點不只在模型本身,而是把模型放進能夠完成多步驟工作、使用工具和產出文件的產品環境。
SpaceXAI 表示,Grok 4.5 的訓練資料涵蓋 coding、science、engineering 和 mathematics,並以數十萬個任務進行 reinforcement learning,集中處理多步驟軟件工程和其他技術工作。官方亦表示,Agentic rollout 可以在非同步訓練流程中運行數小時,訓練規模涉及數以萬計的 NVIDIA GB300 GPU。
發布頁列出多項官方 benchmark 結果,包括 Terminal Bench 2.1 的 83.3% 和 SWE-bench Pro 的 64.7%。SpaceXAI 又稱,Grok 4.5 在 SWE-bench Pro 每個任務平均輸出 15,954 個 token,對比頁面列出的 Opus 4.8 約 67,020 個 token,約少 4.2 倍。這些數字來自 SpaceXAI 的發布頁,部分比較結果引用其他開發者的 system card 或 benchmark leaderboard,應視為供應商公布的測試結果,而非獨立重測結論。
模型同時成為 Grok Build 的預設模型。SpaceXAI 展示的用途包括由一句指令建立完整應用程式、進行網上研究後製作 Excel 模型,以及在 PowerPoint 和 Word 裡使用原生形狀建立簡報和文件。Grok 4.5 也可在 Cursor 和 SpaceXAI API 使用,官方列出的 API 價格是每百萬個 input token 2 美元、output token 6 美元。
對 Agent 工作流來說,這次發布反映的變化是「模型能力」和「執行環境」開始綁在一起。模型能否寫 code 只是第一步,真正影響交付結果的還包括工具權限、檔案隔離、測試流程、回滾方式和人手審批。當模型可以直接建立檔案、修改專案或產出辦公室文件時,權限和審計記錄就不能留到最後才補上。
因此,Grok 4.5 的 benchmark 和 token 效率值得留意,但不應直接等同於每個團隊都會得到相同成果。實際評估仍要用自己的 codebase、文件、工具和成功標準重跑,並將高風險操作維持在可審批的範圍內。Agent 能夠完成更多步驟,並不代表它可以跳過驗證。



