马斯克新AI考了61分,能打过中国对手吗

AIGrok大模型

数据源:HN + web research · HN

2026年8月13日,马斯克的 xAI 发布新 AI 模型 Grok 4.6。同一天,中国的 DeepSeek 和阿里也各自亮出新品:DeepSeek V4 Pro、通义千问 Qwen3.8。三家头部公司,同一天亮牌。技术圈论坛 Hacker News(黑客新闻,程序员聚集地)一晚上涌进 367 条评论,有人直接问:这是不是故意跟着 DeepSeek 发的?

Grok 4.6 是什么?一句话:一个更会”干活”的 AI。以前的 AI 擅长聊天,你问一句它答一句;这一代主打”长跑”——连续工作几十分钟不停:帮你研究一个课题、整理一堆资料、把一个想法做成能用的软件。像雇了个不用睡觉的实习生。这背后是整个行业的方向变化:AI 从”陪聊”走向”替你上班”。

它到底多强?看第三方考卷。AI 界有个独立的”考试机构”叫 Artificial Analysis(人工分析),把 9 项能力测试合成一个分数,叫综合智能指数(AAII,Artificial Analysis Intelligence Index)。Grok 4.6 考了 61 分:和 OpenAI 的旗舰模型 GPT-5.6 Sol 并列,比上一代 Grok 4.5 的 56 分高 5 分,比 Anthropic 的 Claude Opus 5(63 分)低 2 分。第三方媒体给出的位置是:世界第三。

Grok 4.6 在 AAII 综合智能指数上得 61 分,与 GPT-5.6 Sol 并列,仅次于 Anthropic 两兄弟

图:综合智能指数(AAII)对比:Grok 4.6(61分)与 GPT-5.6 Sol 并列,Fable 5 Max 62 分居首。来源:artificialanalysis.ai

61 分到底算第一梯队,还是算追赶者?评论区吵翻了。挺它的人说:和 OpenAI 旗舰并列、总分进前三,不是第一梯队是什么。泼冷水的人说:拆开看单项,写代码测试 DeepSWE 里它只有 65.9%,对手 73%;操作电脑的 Terminal-Bench 里它 26%,对手 34.6%——总分接近,单项差距不小。还有一层得说清楚:这些分数虽然经过第三方复核,但考卷本身也在快速变难,上个月还考 90 分的模型,这个月可能只剩 70。笔者的看法:差距已经缩到个位数,而 2026 年 AI 竞争的胜负手,恰恰就在这几分里——比分接近时,价格、速度、稳定性才决定谁赢。

有个用户实测最能说明问题。同一个人,同一件复杂任务,两家各跑一遍:DeepSeek V4 Pro 用了 12 分 02 秒,花费 0.12 美元(约 1 块钱人民币),结果有个 bug;Grok 4.6 用了 3 分 18 秒,花费 1.41 美元(约 10 块钱),结果一次通过。价格差 12 倍,质量差一档。独立机构的长任务测试也是这个味道:同类工作,Grok 平均 53 轮交互搞定,Claude Opus 5 要 103 轮,前者读取的数据量只有后者的四分之一。少一半的步骤、四分之一的话——省下的全是钱。

长任务知识工作测试:Grok 4.6 得分 1577,交互轮次约为 Claude Opus 5 的一半

图:长任务知识工作(AA-Briefcase)得分与效率对比。来源:artificialanalysis.ai

这组数字的工程含义很清楚:贵的那个快 4 倍、还少返工;便宜的那个省 12 倍的钱,但你可能要多花半小时改 bug。个人用户怎么选,看你的时间值多少钱;企业怎么选,这是成本表上明明白白的一行。顺便说一句,AI 算账用的单位叫 token(令牌,AI 处理文字的基本单位),价格战打的不是总价,是每个令牌多少钱。

为什么 Grok 快而贵、DeepSeek 慢而便宜?背后是两条工程路线。Grok 靠硬算力:xAI 在孟菲斯建了超级计算机 Colossus(巨像),号称世界最大规模的 AI 算力集群之一。算力足,模型就敢多想几步,出活快,但电费贵。DeepSeek 走巧劲:用专家混合架构(MoE,Mixture of Experts——把一个大模型拆成一堆小专家,每次只唤醒需要的几位)把算力花在刀刃上,成本压到极致。两条路线没有高下之分,只是取舍不同:用钱换时间,还是用时间换钱。在定价上,Grok 4.6 每百万令牌输入 2 美元、输出 6 美元,比同级对手便宜六成以上——xAI 嘴上不提降价,身体很诚实。

Grok 4.6 与同级模型的 API 定价对比

图:API 定价对比:Grok 4.6 为 $2/$6(每百万 token 输入/输出),低于 Claude Opus 5($5/$25)与 GPT-5.6 Sol($5/$30)。来源:artificialanalysis.ai

马斯克为什么押这么大?因为他要的不是一个聊天机器人。特斯拉的车要装 AI 大脑,机器人 Optimus 也要装 AI 大脑;他还买下了编程工具 Cursor——HN 上的说法是花了约 600 亿美元 SpaceX 股票——数百万程序员的日常操作数据,反过来又喂给 Grok 训练。数据、算力、落地场景,三样全押。他赌的是:AI 会成为所有生意的操作系统。

同日三强对决,真正的信号是”中国时间”。Reddit(国外版贴吧)网友说得直白:DeepSeek 就是这一小时发的。过去是美国先发、中国跟进,中间隔好几个月;现在同一天发,追赶周期从”年”缩到了”小时”。打法也不同:中国这边,Qwen3.8 开放权重(open weights,把模型配方公开,谁都能下载研究),DeepSeek 便宜到接近白菜价;美国那边,闭源但和自家产品绑得深。对普通人,这场竞争最大的礼物是价格:AI 的调用成本一年内掉了一个数量级,手机里免费 AI 的脑子越来越聪明。

61 分是门槛,不是终点。分数说明中美差距已经不大,但”不大”不等于”没有”。给读者的实在话:下次用 AI 干活,别只看厂商宣传的分数——让它做一件具体的事,看它能不能一次做对。那才是真正的考试。

参考链接:

  • xAI: Introducing Grok 4.6
  • Artificial Analysis: Grok 4.6 Benchmarks and Analysis
  • Hacker News 讨论(item?id=49274027)
  • Hacker News 讨论(item?id=49275385)
  • VentureBeat: SpaceXAI debuts Grok 4.6