Qwen3.8-Max首度开源5TB权重,自托管部署需9张H200

Qwen3.8-Max首度开源5TB权重,自托管部署需9张H200

Qwen开源模型AI工程大模型部署

数据源:HN + web research

5TB权重上线,开源门槛变成硬件算术题

2026年8月12日深夜,ModelScope 页面上的下载按钮悄然更新,Qwen3.8-2.4T-A95B 的完整权重正式开放下载。从此前 3.5、3.6 到 3.7 时代仅限 API 访问,这是 Qwen 团队第一次将 Max 级别的旗舰模型推向开源社区。

消息发布后,全球开发者的硬盘备战迅速被一组工程数据压沉。bf16 全精度下的模型权重文件达到了 5TB,即便经过 4-bit 量化,显存占用依然保持在 1.2TB 居高不下。开源的衡量标准已经彻底从「能否下载」演变为「能否运行」。

在同日 DeepSeek V4 Pro 0813 与 xAI Grok 4.6 齐发的混战中,阿里的策略转向格外清晰。通过把旗舰权重的控制权交还给开发者,Qwen 试图在闭源巨头环伺的生态中抢占标准制定权。

Qwen3.8 官方 Coding Agent 基准对比表 图:Qwen3.8 官方 Coding Agent 基准对比表截图。来源:qwen.ai 官方博客

2.4万亿参数只醒4%:稀疏激活的工程算计

Qwen3.8-Max 的底层架构延续了 3.5 时代的混合注意力与多 token 预测(MTP)训练。其最核心的工程调整在于极度激进的专家选择:在总计 2.4 万亿参数的 MoE 结构中,每一层部署了 512 个专家,但在每个 token 的前向传播中仅唤醒 10 个路由专家与 1 个共享专家。

这种 11/512 的路由机制将单 token 激活参数严格控制在 95B,全网激活率仅约 4%。极低激活率保证了高吞吐推理的经济性,却无法抹平千亿级参数在显存加载上的物理驻留成本。 参数可以不参与计算,但权重数据必须常驻显存。

在上下文长度上,模型原生支持 256K(262,144 token)窗口,并宣称可通过外推拓展至 1.01M。然而官方尚未公开拓展模式下的质量衰减曲线,工程实测仍需将其视为 256K 上下文模型使用。

从34张到9张H200:自托管属于数据中心

把 2.4 万亿参数放到物理集群中,自托管的算术题展现出冰冷的现实。在 bf16 全精度下,模型需要约 4.8TB 显存,这意味着至少需要 34 张单卡 141GB 显存的 H200 GPU 才能完成最基础的加载与推理。

当采用 4-bit 极端量化压缩显存至 1.2TB 后,集群需求降低到了 9 张 H200。即使采用 1.5-bit 量化将显存压至 450GB,依然需要 4 张 H200 组成的计算节点,同时伴随着未经验证的精度损失。社区那句「稀疏激活让规模化运行变便宜,却没让拥有它变便宜」深刻揭示了当下大模型自托管的门槛转移。

对于绝大多数个人开发者与中小团队,本周同步开源的 Qwen3.8-27B 才是可落地的本地选择。4-bit 量化后仅需 27GB 显存,单张消费级显卡就能轻松驱动。

Text Arena 排行榜 图:Text Arena 排行榜,Qwen3.8-Max 位列第 5。来源:阿里集团公告

Vision Arena 排行榜 图:Vision Arena 排行榜,Qwen3.8-Max 位列第 2。来源:阿里集团公告

拆解官方基准表:前沿领先与Agent短板

根据官方公布的测试成绩,Qwen3.8-Max 在 Text Arena 排行榜中位列第 5,Vision Arena 中升至第 2。在学术推理测试 PaperBench 上,它以 93.0 的高分击败了 GPT5.6 Sol 的 90.5 与 Claude Fable 5 的 88.8,夺得全场第一。这说明在文献理解与单步骤复杂推理场景中,开源模型已经具备压制闭源旗舰的能力。

然而在工程 Agent 评估中,「仅次于 Claude Fable 5」的宣称遇到了现实挑战。在 SWE-bench Pro 测试中,Qwen3.8-Max 仅得分 67.7,落后 Claude Fable 5 的 80.0 超过 12 分;FrontierSWE 同样以 73.5 落后于 Fable 5 的 88.8。在长流程代码修改与复杂软件工程中,它与顶级闭源旗舰依然存在可观测的代际差距。

审视这份成绩单还需要注意细节避坑。多模态对比表选取了上代 Qwen3.7-Plus 作为基准而非 Max 版本,夸大了代际涨幅;而在官方 RL 强化学习 scaling 曲线中,测试准确率在 4000 个训练环境时触顶 0.725,后续继续增加训练量反而回落至 0.689。

每百万Token两美元,云端生态争夺战

自托管的高昂壁垒将大多数流量重新推回了 API 市场,而阿里给出了激进的定价。Qwen3.8-Max 云端 API 输入价格定为 $2.00/M token,输出 $6.00/M token,配合 $0.25 的隐式缓存读取,整体成本显著低于 Kimi K3 的 $3.00/$15.00。

API 协议原生兼容 OpenAI 与 Anthropic 双重格式,开发者无需修改代码库就能在 Claude Code、Cursor 及 OpenCode 间无缝切换。但在实际使用中,有开发者反馈其深度推理模式过于沉溺多轮自我校验,低阶订阅用户甚至在两天内烧光了原本可供一周使用的 5000 万 token。如何通过 reasoning_effort 参数精准控制推理深度,成了使用云端 API 的首要工程功课。

阿里在官方博客中展示了该模型自主运行 16 天构建 agent 框架 oh-my-cli,以及在 WWW2025 挑战赛中击败 87% 人类队伍的记录。旗舰开源是一场精美的姿态,而依靠低价 API 与高粘性工具链锁住开发者生态,才是这场大模型军备竞赛的底牌所在。

参考链接:

  • Qwen 官方博客:Qwen3.8-Max: A New Bar for Coding and Cowork
  • 阿里集团公告
  • ModelScope 权重页
  • aireiter: Qwen3.8 Open Weights
  • MarkTechPost 报道