Kimi K3 登場:2.8T 開放 frontier model 把長程 coding agent 推向下一階段

Moonshot AI 於 7 月 16 日介紹 Kimi K3,主打 2.8T 參數、原生視覺、1M token context 和長程 coding agent;完整模型權重預計於 7 月 27 日發布。

Moonshot AI 於 2026 年 7 月 16 日介紹 Kimi K3,把它定位為一個開放的 frontier intelligence model。官方頁面列出的核心規模是 2.8T 參數、原生視覺能力和 1M token context,並把長程 coding、知識工作和深度推理放在主要用途。模型現時已可在 Kimi、Kimi Work、Kimi Code 和 Kimi API 使用,完整模型權重則預計於 7 月 27 日發布。

Kimi K3 的工程重點不只在參數量。Moonshot 表示,模型採用 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),再配合 Stable LatentMoE,把 896 個 experts 中的 16 個用於每個 token。公司稱這些架構改動相對 Kimi K2 帶來約 2.5 倍的整體 scaling efficiency;實際成本仍要看硬件、並行策略、上下文長度和服務端配置。

這個模型最值得注意的地方,是它把「長時間做事」放在能力展示的中心。Kimi K3 的 coding 說明包括在最多 24 小時的沙盒內分析和優化 GPU kernel、建立類似 Triton 的 MiniTriton compiler,以及用視覺迴路反覆修改遊戲、前端和 CAD 輸出。這些案例是 Moonshot 的內部或產品測試敘述,不應直接視為獨立 benchmark 結論。

知識工作展示也採用相同思路。官方描述 Kimi K3 可以閱讀論文、寫出數值流程、執行驗證、產生互動式 HTML dashboard,並用並行 subagents 做科學分析。其中案例聲稱模型在約兩小時內完成通常需要一至兩星期的研究工作;這些速度數字最適合用來理解產品方向,不能直接當成可泛化的生產承諾。

在部署層,Kimi K3 使用 MXFP4 weights 和 MXFP8 activations,並建議以 64 個或以上 accelerators 的 supernode 配置部署。官方亦表示正把 KDA 的 prefill cache 實作貢獻到 vLLM 生態系統;API 價格列為 cache-hit input 每百萬 token 0.30 美元、cache-miss input 3 美元、output 15 美元,採用前應以最新平台頁面為準。

官方同時公開了重要限制:Kimi K3 對 thinking history 的傳遞方式很敏感,如果 agent harness 沒有完整保留歷史內容,或中途從另一個模型切換,生成質量可能不穩定。模型也可能過度主動,在指令含糊或遇到小問題時替使用者作出未授權的決定。長程執行會放大上下文遺失和權限過寬的風險。

完整權重尚未在今天發布,是理解這次消息的另一個關鍵。2.8T 的總參數不等於每次推理都會啟用同樣的計算量,也不代表普通團隊可以直接用一般工作站部署。開放模型帶來可審查、可微調和可自建的可能,但同時需要硬件、量化、推理框架、agent harness 和安全政策配合。

Kimi K3 的發布把開放模型競爭推到一個更具體的位置:不是只比較單次問答分數,而是比較模型能否在很長的任務中保持上下文、呼叫工具、處理視覺資料、驗證結果和適時停下來。當完整權重、技術報告和更多獨立評測出現,市場才可以更準確判斷它在 frontier model 和 coding agent 生態中的位置。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。