中国AI在测试中打败了GPT-5——而且它完全开源

中国AI在测试中打败了GPT-5——而且它完全开源

Kimi K3Moonshot开源大模型AI月之暗面

数据源:HN + web research · HN

7月16日,中国AI公司月之暗面(Moonshot AI)发布了Kimi K3——一个拥有2.8万亿参数的超大规模语言模型,在多项技术基准测试中超越了OpenAI的GPT-5,并且承诺在7月27日前完全开放模型权重。消息一出,Hacker News上的讨论帖迅速冲上1023分、630条评论,社区从最初的”又一个中国模型”敷衍了事,转向了真正的技术分析。但与此同时,一条关于API服务条款的争议正在评论区发酵:月之暗面的API协议默认允许用客户数据继续训练模型——「开放」和「隐私」的战线,被推到了API层。

Kimi K3发布主视觉图 图:Kimi K3发布主视觉。来源:kimi.com

2.8万亿参数是什么概念?

要理解这件事为什么重要,得先知道一个背景:过去一年多,开源AI模型的「个头」一直在涨,但此前最大只到DeepSeek V4 Pro的1.6万亿参数。Kimi K3一举把这个上限推到了2.8万亿——几乎是前纪录的两倍。如果拿建筑来比喻,之前的开源模型像30层的高楼,Kimi K3相当于直接盖到了55层。

但「参数多」不自动等于「能力强」。真正让人侧目的是这次配套的几项技术突破。笔者试着用最直白的方式解释其中两个核心创新:

“专家分工制”(MoE混合专家模型):传统模型像一个通才,每次回答问题要把大脑全部跑一遍。Kimi K3内部有896个「专家模块」,每次只唤醒其中16个最相关的。打个比方:你去医院看病,不需要全院800多个医生都来会诊,挂对科室就行。这种设计让K3的效率比前代K2提升了约2.5倍——用同样的算力,能产生更强的智能。

“注意力残差连接”:这是月之暗面自研的架构改进。通俗地说,就是让模型在深度思考时能「回头看」前面几层的信息,不至于读到后面忘了前面。就像你读一本厚小说时,读到第800页还能清晰记得第3页埋下的伏笔。这项技术配合百万字级别的上下文窗口(一次能处理的文字量约等于三本《三体》),让K3在长文档分析、复杂编程任务上表现出色。

根据月之暗面公布的测评数据,Kimi K3在多项基准测试中超越了GPT-5.5高算力模式和Anthropic的Claude Opus 4.8,但仍然落后于当前最强的闭源模型——Claude Fable 5和GPT-5.6 Sol。在Arena.ai的前端代码竞技场上,K3甚至一度登顶,超过了Claude Fable 5。

Kimi K3基准测试对比 图:Kimi K3与其他模型的基准测试对比。来源:kimi.com

免费开放,但不免费隐私

到这里,故事听起来像是一场「中国开源力量逆袭美国闭源巨头」的热血剧。但HN评论区里,一条高赞评论给这场狂欢浇了盆冷水。

用户dovin贴出了月之暗面API服务条款中的一段原文:平台「可能使用客户内容来提供、维护、开发、支持和改进服务」,除非客户另行签订书面协议。翻译成大白话:你用Kimi API传上去的数据,公司默认可以拿去训练下一代模型。

这对程序员群体来说是炸裂级别的信息。在美国的AI生态中,OpenAI和Anthropic的API条款明确规定:通过API传输的数据不会被用于模型训练。这是一个行业惯例,也是企业客户愿意把敏感业务接入API的信任基础。月之暗面把这条线划在了完全不同的位置。

评论区迅速分裂成两派。一派认为「OpenAI和Anthropic也好不到哪去,至少中国公司把模型开源回馈社区了」;另一派反驳「不一样——美国公司在API层面有明确的法律约束,违反会被集体诉讼告到破产,而中国AI公司你几乎没有法律追索途径」。

笔者不做裁决。但这个争议确实揭示了一个正在发生的范式转变:过去我们关注的是「模型本身开不开源」,现在战场已经推进到了「围绕模型的服务条款开不开放」。开源权重让你能自己部署、自己控制数据流向;但如果你用的是官方API,那个小小的服务条款勾选框,可能比代码开源本身更能决定你的数据命运。

为什么这件事值得普通人关注?

你可能不会去部署一个2.8万亿参数的模型——这需要的显卡成本足够在一线城市买套房。但这件事的三个涟漪效应,最终会波及到每一个用AI的人:

第一,价格战会升级。Kimi K3的定价是输入100万token收3美元、输出100万token收15美元,这在国产模型中是最贵的,但放在全球范围仍然远低于GPT-5.6 Sol。当一个性能接近顶级的开源模型出现,任何公司都可以自己部署、自己定价,闭源厂商的高溢价空间会被持续压缩。

第二,「中国开源 vs 美国闭源」的叙事在改变。从DeepSeek到Kimi,中国AI公司在开源社区的投入是实打实的。Hacker News上一位用户评论说「中国公司至少把成果回馈给了社区」——这种情绪在一年前几乎不可想象。无论你对数据隐私条款持什么立场,中国AI在开放科学层面的贡献正在被全球开发者认真对待。

第三,「开放」的定义本身在变化。Kimi K3的案例让行业开始面对一个更精细的问题:一个模型可以同时是「开放的」(权重公开可下载)和「封闭的」(API数据被用于训练)。过去用「开源/闭源」的二分法来讨论AI模型已经不够用了,我们需要一套新的语言来描述不同程度的开放。

魔鬼在细节里

有一点需要保持冷静:目前公布的测评数据全部来自月之暗面自身。独立第三方机构Artificial Analysis的评估报告也刚刚出炉,初步结论与官方数据方向一致但并非完全重合。模型权重也要等到7月27日才能真正下载验证。在AI行业,厂商自报的benchmark和社区实测结果之间经常存在差距——笔者不会用「一定会翻车」来预言,但「等社区跑完再说」始终是理性的选择。

知名开发者Simon Willison在实测中发现,Kimi K3完成同一任务消耗的推理token数量明显多于GPT-5.6 Sol——也就是说,虽然单token价格更低,但实际完成任务的成本优势并没有表面数字看起来那么大。这涉及到AI领域一个常被忽视的维度:token效率。

Kimi K3的发布,大概率会被写进2026年AI行业的关键节点。它同时搅动了「开放权重」「数据隐私」和「中国vs美国」三条敏感的神经,迫使整个行业开始面对更复杂的问题。这比一个单纯的benchmark分数,意义要深远得多。

参考链接:

  • Kimi 官方博客:Kimi K3 发布公告
  • HN 讨论 (item?id=48935342)
  • Artificial Analysis: Kimi K3 独立评测
  • Simon Willison: Kimi K3 与鹈鹕测试
  • VentureBeat: 中国月之暗面发布全球最大开源模型 Kimi K3