阿里AI登顶世界第一:第一次赢过GPT-5.6

AI大模型Qwen国产AI

数据源:HN + web research · HN

2026年8月7日,一份第三方评测把阿里的新模型排到了世界第一。Qwen3.8 Max 在 Artificial Analysis 的「智能体指数」上登顶综合第一,这是中国模型第一次在「让AI自己干活」这项能力上赢过美国同行。排在它后面的,是 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5。

消息在 Hacker News 上发酵得很快。上线几小时,帖子攒了 391 分、251 条评论。那是全球最挑剔的一批工程师聚集的地方,评论区最高赞的一句话是:「中国已经追上了,这就是这条新闻的核心。」

这届评测,换了考题

先说这个榜单是谁。Artificial Analysis 是一家独立评测机构,不卖模型,只把各家模型拉到同一套环境里跑分。过去几年,它测的是知识问答、数学推理这类「考试题」——你问我答,看谁答得对。

今年 6 月,它把考题换了。新指数测的是「智能体」能力:给模型一台真实电脑,让它自己上网查资料、自己写代码、自己操作软件,把一个多步骤任务从头到尾做完。任务覆盖 44 个职业、9 大行业,模型干完活,机器判卷老师检查结果对不对。这个分数由两项核心评测加权而来:真实工作任务,和银行场景的多步工具操作。

Artificial Analysis 智能体指数榜单截图 图:Artificial Analysis 智能体指数榜单(2026 年 8 月 7 日截图)。来源:artificialanalysis.ai

Qwen3.8 Max 拿了 58.4 分,GPT-5.6 Sol 是 57.8 分,Claude Fable 5 是 56.6 分。榜首位置并不稳——它和 Anthropic 另一款旗舰 Opus 5 的差距不到 1 分,这几天反复易手。工程上的读法是:头部模型的干活能力已经贴脸,谁都不敢说稳坐第一。

单点登顶之外,榜单上是一整排中国名字。前五名里中国模型占了两席,前十三名里占了四席——除了阿里的 Qwen,还有月之暗面的 Kimi、DeepSeek 和智谱的 GLM。两三年前,这类榜单的头部还是清一色的美国公司。

以前比谁能答对题,现在比谁真能把活干完。答题厉害,不一定会干活;会干活,说明知识真的用起来了。

会聊天和会干活,差在哪

差别在三个地方。

第一,多步规划。聊天是一次回答,干活是一串动作。就像给实习生派活:查三个航班比价,选最便宜的,行程发进邮箱,再订好酒店——每一步都要记得住大目标。普通模型做着做着就忘了最初要干嘛。

第二,工具调用。实习生干活要自己查资料、打电话、开软件,AI 干活同理:自己开浏览器、敲命令行、操作表格。Qwen3.8 Max 在「操作电脑」这项评测里拿了 86.1 分,超过 GPT-5.6 Sol 的 83.2 分。它换了多种编程助手环境,表现也基本一致——不挑工具,说明能力长在模型身上,而不是长在某套软件里。

Qwen3.8-Max 在不同编程助手环境下的表现对比 图:Qwen3.8-Max 在多种工作环境下的表现对比。来源:qwen.ai 官方博客

第三,边干边检查。干完一步回头看:界面歪了自己改,电视方向不对自己转。这种「眼睛盯着自己干活」的反馈回路,是这一代模型的新东西,也是它能连续干几小时不出轨的原因。

它能干到什么程度

阿里公布了几组实测数据,笔者挑三组说。

电商运营模拟跑了一年:模型拿着 10 万块本金同时经营多家网店,面对近 600 家供应商,以及藏在里面的 152 家骗子公司,还要应付台风断货、大促爆单。一年下来期末余额 41.6 万,翻了 4.16 倍——比第二名高 38%,比上一代旗舰高 152%。

芯片设计:给它一个加密芯片的初始电路,8298 个逻辑门。它自己跑了 500 轮「改代码—仿真—查错」,最后压到 678 个门,芯片面积缩小 81%。

竞赛:一场有 526 支人类队伍参加的算法比赛,它 24 小时独立参赛,击败 87% 的人类队伍。读规则、调模型、决定提交 45 次,全是自己来。

Qwen3.8-Max 官方性能对比图 图:Qwen3.8-Max 官方性能对比图(与 GPT-5.6 Sol、Claude Opus 4.8 等对比)。来源:qwen.ai 官方博客

这些数字是阿里自己公布的,第三方还没全量复测。笔者按惯例打个折看:方向可信,幅度待验证。

能干,但话痨

登顶不便宜。评测机构的数据显示,Qwen3.8 Max 干同样的活平均要 64 轮交互,上一代只要 14 轮;输入量涨了约 15 倍,输出 token 达到 1.45 亿。干活更扎实的代价,是更啰嗦、更费算力。

它的速度也是中游:每秒 67 个 token,同场最快的 Gemini 3.6 Flash 是 213 个。跑完一整轮智能体评测,烧掉了 1741 美元的算力账单。

能干和划算之间,还有一段距离。但价格端,它输入每百万 token 收 2 美元、输出 6 美元,比同档美国模型便宜;阿里还宣布下周开放权重——Max 级旗舰第一次开源。开源意味着任何公司都能拿去部署,价格还会被打下来。

评论区在吵什么

榜单头部分数聚拢,评论区吵起来了。一派认为这是「蒸馏」的证据:分数挤在一起,是因为小模型在偷师大模型的输出。也有人反驳:拿别人的输出去训练并不违法,人类学习不也是这么来的。

也有工程师晒出真实体验:花 15 美元充了 DeepSeek,几个复杂项目做完,回头再看自己每月 200 美元的 OpenAI 订阅,直呼后悔。个人感受不能当证据,但这类声音越来越多,本身就在改变市场预期。

另一条线是法律争议。有评论说,某家美国大厂此前认罚但没有认罪,法律上这件事仍算 theft——「偷来的东西,再偷一遍算不算偷」。这个问题没有答案,笔者不站队。还有人认为分数聚拢说明大模型能力快见顶了。见顶与否,要看榜单下次改版把考题出到多难。

普通人的 AI,要换用法了

这一轮竞争,跟你有关的部分不在榜单上。

过去两年,AI 给你的是答案:写一段文案、答一道题。现在开始给你结果:扔给它一堆报销单,它整理成表格发你邮箱;说一句要去杭州出差,它自己查航班、比价、下单。这些能力装进手机 App,只是时间问题。

榜单会继续波动。方向已经明确:AI 的下一个时代,属于能把活干完的模型。

参考链接:

  • Artificial Analysis: Agentic Index 榜单
  • HN 讨论 (item?id=49200652)
  • 阿里云/Qwen 官方博客
  • MarkTechPost 发布报道
  • VentureBeat 评测报道