7 月 27 日,Moonshot AI 按照承诺公开了 Kimi K3 的完整模型权重,同时放出了配套的技术报告。这份 71 页的报告是过去一年 Kimi 系列在架构、训练和部署三个方向上技术积累的集中亮相。
规模与架构:三个数字
Kimi K3 的几个关键数字:
- 2.8T 总参数,104B 激活参数
- 896 个 MoE 专家,每 token 激活 16 个
- 100 万 token 上下文窗口,原生多模态
这三个数字让 K3 成为目前公开的开源模型中参数总量最大的一个。在开源模型的规模竞赛里,Kimi 系列过去 12 个月里有 9 个月在刷新上限——从 K2 到 K2.6,再到现在的 K3。
架构层面,K3 沿用了 Kimi Linear 的基本骨架,但做了三处关键替换。
混合注意力:KDA + Gated MLA
Attention 部分的改动最大。K3 采用了一种逐层混合的注意力策略——每个 Block 内 3 层 Kimi Delta Attention(KDA) 搭 1 层 Gated Multi-head Latent Attention(Gated MLA),3:1 的比例。
KDA 是 Moonshot 自研的线性注意力机制,核心思路是用一种近似的、计算量更低的方式替代标准 scaled dot-product attention 中的 softmax 操作。它与 DeepSeek V4 的 MLA(Multi-head Latent Attention)不同——MLA 侧重压缩 KV cache 大小,KDA 侧重改变 Attention 的计算路径。
Gated MLA 则在 MLA 的基础上引入了一个门控机制,让模型在注意力计算中多了一层选择性。两种注意力交替使用,长序列场景下由 KDA 承担大部分计算,Gated MLA 负责保留全局信息的精确性。
这一整套混合策略的动机很直接:2.8T 参数的模型如果全部用标准 Attention,推理成本会高到无法落地。线性注意力的近似代价换来的是可接受的推理成本。
Attention Residuals:跨层的信息高速公路
Attention Residuals(AttnRes)解决的是另一个问题:深度网络中层与层之间的信息衰减。
传统的残差连接(ResNet 式的 shortcut)把每一层的输入直接加到输出上。AttnRes 的做法更灵活——它用一个可学习的注意力权重去决定”上一层的哪些信息值得传递到这一层”。多个 Block 之间通过 Attention Score 做加权连接,让信息可以跨越较深的层级直接传播。
根据技术报告的说法,AttnRes 在训练和推理环节分别引入约 4% 和 2% 的额外成本,但能持续地改善 validation loss 和下游任务表现。这是一个”花小钱办大事”的设计——成本增量微小,但收益在 2.8T 规模下会被放大。
NoPE:丢掉位置编码的开源前沿模型
K3 还有一个值得注意的设计选择:完全去掉了 RoPE(旋转位置编码),改用 NoPE(No Positional Embeddings)。
近几年主流大模型几乎全部采用 RoPE 作为位置编码方案(包括 Llama、DeepSeek、Qwen 等),K3 的做法算是逆流而动。不过 Kimi Linear 去年已经在 48B 规模上验证了 NoPE 的可行性,这次是直接把同样的方案放大到了 2.8T。
在 K3 之前,只用 NoPE 的模型基本停留在小规模实验阶段。K3 是第一个在前沿规模上实践 NoPE 的模型。这一选择的影响还有待更长时间的社区验证来评估。
训练技巧汇总
技术报告里还披露了一组训练层面的创新:
- Stable LatentMoE:在前馈层做低秩压缩,降低参数存储和计算量
- Quantile Balancing:基于 router-score 分位数分配专家,替代启发式的负载均衡
- Per-Head Muon:对 Muon 优化器的一个 Attention Head 级别扩展,让每个 head 独立学习率
- SiTU 激活函数:Sigmoid Tanh Unit,替代标准的 SwiGLU/GeLU
- MXFP4 QAT:从 SFT 阶段就开始做量化感知训练,权重用 MXFP4、激活用 MXFP8,不是后训练量化
这些技巧单个看都不是”颠覆性”的,但组合在一起构成了 K3 的 2.5× 规模效率提升——即每单位算力产出的智能量是 K2 的 2.5 倍。
图:K3 技术报告中的架构图和 MoE 专家路由示意。来源:arXiv 2607.24653
基准测试:在哪追上,在哪落后
Moonshot 在技术报告中贴出了详细的 benchmark 对比。表格包含了 Fable 5、GPT-5.6 Sol、Opus 4.8、GPT-5.5 和 GLM-5.2 等模型的分数。
K3 的表现可以简单概括为:在编程和 agentic 类任务上领先或持平,在通用推理上紧随前列,在总体智能评分上仍排在 Fable 5 和 GPT-5.6 Sol 之后。
值得单独提几项:
- Program Bench:K3 77.8,GPT-5.6 Sol 77.6,Fable 5 76.8——K3 最高
- SWE-Marathon:K3 42.0,Opus 4.8 40.0,GPT-5.6 Sol 39.0——K3 领先
- Terminal-Bench 2.1:K3 88.3,Fable 5 84.6——K3 领先
- BrowseComp:K3 91.2,GPT-5.6 Sol 90.4,Fable 5 88.0——K3 最高
- FrontierSWE dominance:Fable 5 86.6,K3 81.2,GPT-5.6 Sol 71.3
- Artificial Analysis 智能指数 v4.1:K3 57.1,排第 4(Fable 5 59.9、GPT-5.6 Sol 58.9、Opus 4.8 55.7)
K3 在编程类 benchmark 上的表现特别突出——它赢了 6 项 agentic 编程 benchmark 中的 5 项。这恰好与 Kimi Code 的产品定位一致:K3 在设计上有意强化了长期编程会话的能力。
图:K3 与各模型在 Coding、General & Visual Agents、BrowseComp 等 benchmark 上的对比。来源:arXiv 2607.24653
价格与部署:开源不等于便宜
K3 的 API 价格:input $3/MTok,output $15/MTok,cache hit $0.30/MTok。这个价格在开源模型中不算低(DeepSeek-V4-Pro 的 input 只要 $1/MTok),但 K3 的作者表示其特殊设计的 KDA prefix caching 可以在编程场景下达到 90%+ 的 cache hit rate,实际有效价格可能更低。
关于自部署,2.8T 参数的模型不是一个 Mac Studio 能搞定的。Moonshot 推荐的部署配置是 64 块以上加速器的超节点。vLLM 在开源的当天就给出了 day-0 支持——这是 vLLM 团队和 Moonshot 提前协作的结果,也为 KDA prefix caching 做了专门的缓存实现。
开源协议与生态影响
K3 采用了一份名为 “Kimi K3 License” 的自定义许可证,带了额外条款——具体细节还在社区讨论中。
K3 的开源有两个直接效应:
一是为社区提供一个可以在本地运行的、接近前沿水平的基座模型。不管是微调还是做 inference 优化,社区都有了一个新的参考点。
二是在出口管制的大背景下,K3 证明了即使受限于对华芯片限制,中国团队仍可以训练出接近世界前沿水平的模型。Tom’s Hardware 等媒体的报道已经提到了这一点,也有消息称 K3 发布后 4 天内美国方面就有政策层面的反应——虽然具体措施还不明朗,但”开源了你就管不着”这条逻辑可能会加速讨论。
小结
Kimi K3 的技术报告是一份工程文档,没有太多花哨的叙事。它展示的是 Moonshot 在架构选型上的几个关键判断:线性和全局注意力的混合方案、不加位置编码、跨层残差改造——每个决策都有成本收益的数据支撑。
从规模上看,K3 的开源是开源模型朝着前沿水平又迈了一步。从架构上看,它提供的是一套可以在万亿参数级运行的工程方案,而不是理论上的突破。从行业影响上看,它让”开源 vs 闭源”的叙事更复杂了——当开源模型在编程和 agent 任务上能追平闭源顶配,选择闭源 API 的理由就少了一个。
参考链接 Kimi K3 官方技术博客 arXiv 技术报告 (2607.24653) HuggingFace 模型仓库 GitHub 仓库 HN 讨论 (48935342) Tom’s Hardware 报道