
Moonshot AI 于 2026 年 7 月 16 日介绍 Kimi K3,把它定位为一个开放的 frontier intelligence model。官方页面列出的核心规模是 2.8T 参数、原生视觉能力和 1M token context,并把长程 coding、知识工作和深度推理放在主要用途。模型目前已经可以在 Kimi、Kimi Work、Kimi Code 和 Kimi API 使用,完整模型权重预计于 7 月 27 日发布。
Kimi K3 的工程重点不只是参数量。Moonshot 表示,模型采用 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),再配合 Stable LatentMoE,让 896 个 experts 中的 16 个参与每个 token。公司称这些架构改动相对 Kimi K2 带来约 2.5 倍的整体 scaling efficiency;实际成本仍要看硬件、并行策略、上下文长度和服务端配置。
这个模型最值得关注的地方,是它把“长时间做事”放在能力展示的中心。Kimi K3 的 coding 说明包括在最多 24 小时的沙盒内分析和优化 GPU kernel、建立类似 Triton 的 MiniTriton compiler,以及通过视觉循环反复修改游戏、前端和 CAD 输出。这些案例是 Moonshot 的内部或产品测试叙述,不应直接视为独立 benchmark 结论。
知识工作展示也采用相同思路。官方描述 Kimi K3 可以阅读论文、编写数值流程、执行验证、生成互动式 HTML dashboard,并用并行 subagents 做科学分析。其中案例声称模型在约两小时内完成通常需要一至两周的研究工作;这些速度数字适合用来理解产品方向,不能直接当成可泛化的生产承诺。
在部署层,Kimi K3 使用 MXFP4 weights 和 MXFP8 activations,并建议以 64 个或以上 accelerators 的 supernode 配置部署。官方还表示正在把 KDA 的 prefill cache 实现贡献到 vLLM 生态;API 价格列为 cache-hit input 每百万 token 0.30 美元、cache-miss input 3 美元、output 15 美元,采用前应以最新平台页面为准。
官方同时公开了重要限制:Kimi K3 对 thinking history 的传递方式很敏感,如果 agent harness 没有完整保留历史内容,或中途从另一个模型切换,生成质量可能不稳定。模型也可能过度主动,在指令含糊或遇到小问题时替用户作出未授权的决定。长程执行会放大上下文丢失和权限过宽的风险。
完整权重尚未在今天发布,是理解这次消息的另一个关键。2.8T 的总参数不等于每次推理都会启用同样的计算量,也不代表普通团队可以直接用一般工作站部署。开放模型带来可审查、可微调和可自建的可能,但同时需要硬件、量化、推理框架、agent harness 和安全政策配合。
Kimi K3 的发布把开放模型竞争推到一个更具体的位置:不是只比较单次问答分数,而是比较模型能否在很长的任务中保持上下文、调用工具、处理视觉数据、验证结果并适时停下来。当完整权重、技术报告和更多独立评测出现,市场才可以更准确判断它在 frontier model 和 coding agent 生态中的位置。



