2026年7月28日,Sebastian Raschka 发了一篇短博客,题目叫《Kimi K3 Architecture Notes》。不是什么长篇技术论文,就是一个架构图的注释——但这个注释放上去之后,迅速冲上了 Hacker News 首页,获得了超过270个点赞。
同一天,去年10月 Moonshot AI 发表的《Kimi Linear: An Expressive, Efficient Attention Architecture》也出现在 HN 首页,同样拿到了260多个 upvote。两篇论文在同一天被西方技术社区推上头条,这不是巧合。
图:Sebastian Raschka 在博客中分析的 Kimi K3 架构图。从 Attention Residuals 到 LatentMoE,每个组件都有独立的设计哲学。来源:Sebastian Raschka
如果说 DeepSeek 在2025年初让西方意识到了中国 AI 的”存在”,那么2026年7月这一天,Moonshot AI 的两篇论文让西方开始认真看待中国 AI 的”原创能力”。
“他们不只是蒸馏”
长期以来,西方科技媒体对”中国 AI”的描述几乎绑定在一个词上:distillation(蒸馏)。今年2月,Anthropic 公开指控 DeepSeek、Moonshot AI 和 MiniMax 使用超过24000个虚假账号、1600万次对话对 Claude 进行系统性蒸馏。美国财政部甚至威胁对 Moonshot 实施制裁。在西方主流叙事中,中国 AI 实验室被塑造成”技术小偷”——自己不搞创新,全靠偷。
但这个叙事正在崩塌。
HN 上点赞最高的评论之一来自用户 constantlm,只有一句话:“So, unlike what leaders of western labs would like you to believe (that Kimi is just the result of distillation attacks), they are introducing new and novel approaches.”(所以,和西方实验室领导想让你们相信的相反——Kimi 不只是蒸馏攻击的结果,他们是在引入新的、原创的方法。)
这句话获得了数十个点赞。评论区里还有更多的声音:有人讨论 NoPE 架构的意义,有人对比 DeepSeek V4 的 Hyper-Connections 和 Kimi 的 Attention Residuals 的技术差异,有人在认真计算 Kimi Delta Attention 的 FLOPs 节省——没有人再提”蒸馏”这个词。
Kimi Delta Attention:线性注意力第一次打败了全注意力
要理解这次事件的份量,需要先理解一个技术背景:线性注意力(linear attention)是一个被研究了多年的方向,目标是解决 Transformer 的核心瓶颈——注意力机制的 O(n²) 计算复杂度。说白了就是,文本越长,计算量指数级增长。线性注意力试图把复杂度降到 O(n),但代价一直都是”效果不如全注意力(full attention)”。
Kimi Linear 论文的核心贡献,就是第一次在公平对比下,让线性注意力在全维度上超过了全注意力——短文本、长文本、甚至强化学习(RL)场景,全部超越。
图:Kimi Delta Attention 的核心思想——每个通道独立控制”写入权重”和”遗忘权重”,让有限的记忆状态被更有效地利用。来源:Zhouyao Xie
实现这一突破的核心模块叫 Kimi Delta Attention (KDA)。它建立在 Gated DeltaNet 的基础上,引入了一个更精细的”门控机制”(fine-grained gating),使得有限的记忆状态能被更有效地利用。传统线性注意力在写入记忆时对所有通道一视同仁,KDA 则对每个通道独立控制”写入权重”和”遗忘权重”——有些信息需要记住,有些需要更新,有些需要丢弃。
这种每一层、每个通道的精细控制,让线性注意力第一次达到了可以和全注意力相提并论甚至更好的效果。
论文还提出了一个巧妙的工程优化:利用 Diagonal-Plus-Low-Rank (DPLR) 矩阵的专门化变体来做硬件加速。在不牺牲模型效果的前提下,KV cache 减少了最高75%,1M 长文本的解码吞吐量提升了6倍。
这里有一个重要的工程判断:线性注意力在过去几年里论文无数,但几乎没有一个在实际生产中被大规模采用,原因是”理论好、硬件差”——数学上 O(n) 很漂亮,但 GPU 上跑不过高度优化的 cuDNN 全注意力 kernel。KDA 专门为此做了硬件感知的 chunkwise 算法设计,使得这个架构真正可以部署到生产环境——不只是停留在论文阶段。
Kimi K3:2.8万亿参数背后的架构哲学
如果说 Kimi Linear 是”发动机”的论文,那 Kimi K3 就是”整车”的落地。
Kimi K3 是 Moonshot AI 在7月16日发布的2.8万亿参数 MoE 模型,896个 expert 中每个 token 激活16个,支持原生视觉理解和1M token 上下文。它是目前全球最大的开源权重模型——不是之一,是唯一。
但真正让 Sebastian Raschka 写博客去分析它的,是 K3 在架构上的一系列大胆选择。
Attention Residuals(注意力残差):这是 K3 的一个独特组件。传统残差连接(residual connection)只是简单地把输入和输出加起来,帮助梯度流动。Attention Residuals 则用一种注意力分数来衡量每层应该”贡献”多少到最终输出——这是一种带权重的聚合,而不仅仅是简单加和。按技术报告的披露,它一致性地改善了验证损失和下流任务表现,增加的训练成本只有约4%,推理成本只有2%。
NoPE(不使用位置编码):这是目前已知的第一个在前沿模型上完全弃用位置编码的架构。近一两年,主流趋势是在局部注意力层用 RoPE、全局层用 NoPE。K3 直接在所有层都去掉了位置编码——这在生产级模型里是从未有过的。
LatentMoE:其实这不算 Kimi 的原创(Nemotron 3 也用了类似方案),但 K3 展示了 LatentMoE 在2.8T 规模上的可行性。核心想法是把专家网络的大线性层压缩到低维隐空间再计算,大幅降低参数量而不损失效果。
Raschka 在博客里总结得很到位:“K3 的整体趋势和 Nemotron 3、DeepSeek V4 一样,是朝着更高的推理效率前进。核心思路是把每个组件替换成效率优化版本。“
同一个社区,不同的声音
笔者的一个观察是,这次两篇论文同时出现在 HN 首页,形成了一个有趣的对话。
Kimi Linear 的 HN 讨论(114条评论)更偏学术讨论——研究人员在争论线性注意力是否真的能替代全注意力、Bitter Lesson 理论、scaling law 的适用性等问题。这是典型的”技术论文上 HN”的画风。
而 K3 架构笔记的 HN 讨论(34条评论)虽然条目少,但信息密度更高——因为帖子本身就是从架构角度看 K3,评论区紧接着就进入了”中国 AI 是否仅仅在蒸馏”的辩论。用户 thatsagasey 评论说 Raschka 是”great LLM researcher/authors”,这本身就是一种背书——当 Sebastian Raschka 这样级别的西方研究者认真分析中国实验室的架构时,蒸馏叙事就已经站不住脚了。
从”跟随”到”原创”的转折点
把时间轴拉长看,中国 AI 实验室在架构层面的原创轨迹是清晰的:
2024年,DeepSeek V2 推出 Multi-head Latent Attention (MLA),被业界广泛认为是 KV cache 优化领域最重要的原创贡献之一。现在几乎所有追求长上下文的高效模型都在借鉴 MLA。
2025年10月,Moonshot AI 发表 Kimi Linear,第一次让线性注意力在全维度上超过全注意力。
2026年7月,Kimi K3 将 Kimi Linear 从 48B 扩展到 2.8T,并在生产环境中验证了这些架构创新的可扩展性。
这不是一个实验室的一次性运气。DeepSeek 的 MoE 架构、MLA,Moonshot 的 Delta Attention、Attention Residuals——这些是多个中国实验室在不同方向上做出的各自原创贡献。
当然,必须客观承认:西方实验室对这种叙事有自己的看法。一些研究者认为,Kimi 的 Linear Attention 固然是进步,但”第一次超过全注意力”的宣称仍需更多独立复现。Gated DeltaNet 方向的探索本身也发源于西方实验室的工作。“原创性”的程度是存在争议的。但争议本身就是一个进步——从”他们只会蒸馏”到”他们的贡献有多大”,话题的位移本身就是承认。
两篇论文背后的产业信号
Kimi K3 发布后,引发了不止技术层面的震动。Bloomberg 报道称 K3 发布当天引发了 Nasdaq 的抛售,美国财政部长 Bessent 甚至威胁制裁。一家中国 AI 初创公司的模型发布能震动美国资本市场——这是一个比任何基准测试分数都更直观的信号。
但笔者关注的是另一个信号:Moonshot 在 K3 上采用了分层许可协议(revenue-tiered licensing),中小企业和研究者可以免费使用权重,大企业则需要付费。这是中国 AI 公司第一次在开源授权上展现出成熟的商业化方法论——在技术和商业之间构建护城河。
结语
两篇论文同日登顶 Hacker News,对 Moonshot AI 来说可能只是巧合。但对整个中国 AI 行业来说,这是一个叙事上的转折点。
当 Sebastian Raschka 逐层分析 K3 的架构图,当 HN 上的西方工程师们在讨论 AttnRes 和 NoPE 的优劣而不是”蒸馏”时,意味着中国 AI 走过了从”产品跟随”到”架构创新”的临界点。Distillation 可以让你追平,但超越需要原创。原创不会一夜之间发生,但当它发生时,不会悄无声息。
2026年7月28日,这个信号来了。
参考链接:
- Sebastian Raschka, “Kimi K3 Architecture Notes”, Jul 28, 2026
- Kimi Team, “Kimi Linear: An Expressive, Efficient Attention Architecture”, Oct 2025 (arXiv)
- Hacker News Discussion: Kimi K3 Architecture Notes (item?id=49085698)
- Hacker News Discussion: Kimi Linear (item?id=49082022)
- Moonshot AI, “Kimi K3 Tech Blog: Open Frontier Intelligence”
- Moonshot AI, “Kimi K3 Quickstart”
- Zhouyao Xie, “Behind Kimi K3: Understanding Kimi Delta Attention”, Jul 2026
- GitHub: MoonshotAI/Kimi-K3
- GitHub: MoonshotAI/Kimi-Linear
- Pandaily, “Deconstructing the Kimi K3 Technical Report”, Jul 2026