2026 年 7 月 16 日,Moonshot AI 发布了 Kimi K3,一款 2.8 万亿参数的混合专家模型。这是目前参数规模最大的开源模型,也是中国 AI 实验室迄今为止价格最高的模型——输入 $3/百万 tokens,输出 $15/百万 tokens,定价对标 Anthropic 的 Claude Sonnet 系列。
然而发布当天最热闹的讨论,并不完全是模型能力本身,而是围绕基准测试的一组老问题:官方自报的分数到底该怎么看?同一个 benchmark,不同模型跑在不同的代码环境里,比较还有意义吗?模型权重承诺 7 月 27 日才开源,这之前的评测又能信几分?
K3 在硬指标上做了什么
从参数上看,K3 是一个 Mixture-of-Experts 架构,总计 2.8 万亿参数,每个 token 激活 896 个专家中的 16 个。配合 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),官方称在长上下文场景下解码速度提升了 6.3 倍。上下文窗口 1M token,支持文本、图像和视频输入。
对照前代 K2 系列(约 1T 参数、256K 上下文),K3 的参数翻了三倍,上下文窗口翻了四倍,还增加了原生多模态能力。Moonshot 在技术博客中给出了几个硬核的 coding 场景演示:K3 在 48 小时内独立完成了一颗芯片的设计(Nangate 45nm 工艺,4mm² 面积,100MHz 主频);它还从头构建了一个类 Triton 的 GPU 编译器(MiniTriton),端到端 nanoGPT 训练收敛曲线与参考实现几乎重合。
这些 demo 展示的是 K3 的长程 agentic 能力——在长时间、多步骤的工程任务中保持连贯性。从定位上看,这比单纯刷一个数学或推理榜单更有说服力。
基准测试成绩:赢在哪,输在哪
Moonshot 官方公布的基准测试表格中,K3 的表现有赢有输,但整体呈现的是一幅足够接近前沿的画面。
在 SWE Marathon(衡量持续多小时的工程会话)上,K3 得分 42.0,领先 GPT-5.6 Sol(39.0)和 Claude Fable 5(35.0)。在 Program Bench 上,K3 以 77.8 小幅领先 Sol(77.6)和 Fable 5(76.8)。Agent 类测试 BrowseComp 和 OmniDocBench 上,K3 分别拿下 91.2 和 91.1,官方称两项均为最高分。
但输掉的项目也很清晰:DeepSWE 上 GPT-5.6 Sol 以 73.0 领先 K3 的 67.5;FrontierSWE 上 Fable 5 的 86.6 明显高于 K3 的 81.2。Moonshot 也直接承认 K3 在 HLE-Full 上落后 Fable 5,整体性能仍不及两家美国的顶尖闭源模型。
独立评测机构 Artificial Analysis 给出的评分更为保守:智能指数 57 分,在所有 189 个模型中排名第 4,落后 Claude Fable 5 和两个 GPT-5.6 Sol 推理配置,但领先 Claude Opus 4.8。私人长程知识工作评估中,K3 的 Elo 得分 1547,比 K2.6 高出 732 分,仅次于 Fable 5。
LMSys 的 Arena 排行榜上,K3 在 Frontend Code Arena 拿下第 1 名,超过 Fable 5。这个排名来自真实开发者的盲测投票,比自报分数更具公信力。K3 从 K2.6 的第 18 位跳到这里,提升幅度也确实可观。

争议的核心:自报分数的可信度
基准测试的争议点集中在比较方式本身,而非 K3 的分数高低。
第一个问题是评估环境的不统一。Moonshot 在发布时说明,K3 在 KimiCode 环境中评估,Fable 5 在 Claude Code 中,GPT-5.6 Sol 在 Codex 中。不同的代码助手环境对模型输出有显著影响——同一模型在不同 harness 下的 SWE-bench 分数可以差出 5-10 个百分点。这意味着跨行比较的精度并不像表格呈现的那样精确。Techsy 的评测文章直接写道:「read these as directional, not as a settled leaderboard」——把这些数字当作趋势方向,而不是已定的排行榜。
第二个更敏感的问题是权重尚未公开。Moonshot 承诺 7 月 27 日开放权重,但发布日到开源日之间有 11 天的窗口期。在这期间,所有评测数据都来自 Moonshot 自家的 API 或官方渠道,外部社区无法部署模型进行独立验证。这是「开源宣言」和「开源事实」之间的灰色地带——宣称自己是 open model,但在第三方能跑起来之前,一切分数都还是 self-reported。
Bank of America 的分析师在报告中提到:「尽管中国持续面临硬件和算力限制,K3 证明了预训练扩展结合架构创新仍能为中国旗舰模型带来阶梯式提升。」这句话的背景是,中国 AI 实验室能获取的 GPU 算力受限,因此要追上美国前沿,必须在架构效率上做出补偿。KDA、AttnRes、Stable LatentMoE 这些技术是性能卖点,同时也是算力受限条件下的生存策略。
第三个问题是定价策略的转变。K3 的 $3/$15 定价使它成为最贵的中国 AI 模型,而之前的 K2.6 只要 $0.95/$4。对于一个标榜「开源」的模型来说,这个定价是反常的——通常开源模型的商业逻辑是低价走量。Moonshot 的解释是 KDA 搭配 prefill cache 可以在 API 层面控制成本(coding 工作负载下缓存命中率超过 90%,命中后输入降至 $0.30/MTok),但 25 美分生成一只鹈鹕的事实仍然说明 reasoning token 的开销不容忽视。
Pelican 测试的意外发现
Simon Willison 在发布当天用 OpenRouter 跑了他的经典「pelican riding a bicycle」SVG 测试。结果本身不差——生成的 SVG 质量不错,视觉问答也返回了准确的 alt text。但几个细节暴露了模型的一些特征。
首先是 token 开销:一次鹈鹕生成消耗了 95 个输入 token 和 16,658 个输出 token,其中 13,241 个是 reasoning token,仅 3,417 个是实际回复。总成本 25 美分。作为对比,GPT-5.6 和 Claude 的鹈鹕通常只需要几分钱。原因之一是 K3 目前只支持一个推理强度级别(max),没有低成本的快速模式。
其次是 tokenizer 的怪事:一句「Generate an SVG of a pelican riding a bicycle」在 OpenAI 的分词器里算 10 个 token,在 Anthropic 的 Opus 4.6 下也是 10 个,但 K3 数出来是 95 个。Simon 只发了一个「hi」给 K3,返回了 86 个 token——这暗示 K3 可能在系统层面拼接了一段约 85 token 的隐藏 system prompt。他试图让它泄露内容,模型拒绝了这个请求。

Simon 在文章中反复强调:鹈鹕测试本身不是一个严谨的 benchmark——它诞生于 21 个月前的一个玩笑,后来意外地与新模型的实际质量有不错的相关性,但这个相关性现在已经断裂了。GLM-5.2 画的鹈鹕比 GPT-5.6 和 Fable 5 都好,但没人认为 GLM 是 Fable 级别的模型。真正有价值的地方在于,这个测试逼着评测者真的去跑一次模型,关注 token 消耗、推理模式、多模态能力等实际体验层面的信息。
市场反应与更大的叙事
K3 发布后,消息在中国 AI 板块引发了明显震荡。Z.ai(发布过备受关注的模型)股价暴跌 28%,MiniMax 下跌 16%,阿里巴巴跌了 4%。这反映出市场对「能力天花板被抬高」的担忧——一旦有实验室推出更强的模型,之前领先者的叙事优势就可能被削弱。
CNBC 的报道引用了 Moor Insights 分析师 Patrick Moorhead 的观点,他将市场反应形容为「与 DeepSeek 恐慌惊人相似的过度反应」,并补充说「我们距离超级智能还很远」。Perplexity 的 CEO Aravind Srinivas 则更关注生态层面的变化:「模型本身不再是产品,产品是把模型放进一个有能力的 harness 里并搭配大量工具。」
这个叙事转变恰好呼应了 Kimi K3 的竞争逻辑——它的优势在长时间 agentic 任务中保持可靠性,而非在每一个静态 benchmark 上打败 Fable 5。在 kernel 优化、编译器开发、芯片设计这些场景中,K3 展示的是「一个模型独立完成复杂工程流程」的能力,而非单次推理的准确率。
但这并不意味着基准测试不再重要。一个自报分数领先但权重尚未开源的模型,一个评分体系因环境差异而难以直接对标的排行榜——这些组合在一起,制造了足够多的讨论空间。社区的态度基本是:等 7 月 27 日权重放出,第三方能独立跑起来,才是真正的考试。
本文的素材来自公开信息和社区讨论。如果你对这个话题有更深入的一手经验,欢迎指出文中的不足。
参考链接:
- Simon Willison 博客:Kimi K3, and what we can still learn from the pelican benchmark
- Moonshot AI 官方技术博客:Kimi K3: Open Frontier Intelligence
- CNBC:China’s Moonshot AI unveils Kimi K3 that rivals OpenAI, Anthropic
- Techsy:Kimi K3 Review: 2.8T Open Model vs Fable 5
- Artificial Analysis:Kimi K3 Intelligence, Performance & Price Analysis
- Hacker News:Kimi K3 社区讨论