2.4万亿参数开源:Qwen3.8-Max将AI推入长周期工程

2.4万亿参数开源:Qwen3.8-Max将AI推入长周期工程

大模型开源AIQwenAgentAI工程

数据源:HN + web research

首次打破 Max 级闭源垄断

2026 年 8 月 3 日,阿里在 qwen.ai 官方博客正式发布 Qwen3.8-Max,并宣布权重将于下周在 Hugging Face 与 ModelScope 同步开源。这是开源社区首次迎来千亿级别以上的 Max 级旗舰大模型,其参数量扩展至 2.4 万亿(2.4T),也是开源领域首个突破万亿参数的多模态大模型。Top-tier 旗舰模型长期由闭源厂商占据。Qwen3.8-Max 的开源代表了参数规模的突破,标志着开源模型首次在旗舰体量上具备了正面迎战 Opus4.8、Fable5 与 GPT-5.6-Sol 的底气。

在官方公布的基准测试中,Qwen3.8-Max 在 PaperBench 取得 93.0 分,高于 Opus4.8 的 80.3 分与 GPT-5.6-Sol 的 90.5 分。数据表明,开源模型在学术研究与长文推理等复杂任务中,已经摸到了闭源顶级前沿的门槛。而在涵盖 200 多页 PDF 与 100 多小时视频的长上下文场景下,模型通过构建视频记忆图谱(video memory graph)展现了高精度的检索效率。开源大模型在特定长文本与多模态场景下的工程能力,已经能够直接与闭源前沿模型展开正面竞争。

Qwen3.8-Max 官方性能对比图 图:Qwen3.8-Max 官方性能对比图。来源:qwen.ai 官方博客

从刷榜到长周期自主执行

大模型评估正从静态单次测试转向长周期自主执行。在开源代码项目 oh-my-cli 的实际测试中,Qwen3.8-Max 连续自主运行 16 天,独立提交了 265 次代码 commit、127 个 PR 与 151 个 issue。模型通过自我构建测试 Harness 完成长周期的项目维护,这说明大模型的能力边界已经从编写单段代码延伸到独立管理完整软件的生命周期。

在无人工干预的学术研究试验中,仅给模型提供论文文本与 GPU 算力,Qwen3.8-Max 在 125 小时内完成了 7,600 行代码编写与 1,100 多次操作。它历经 33 轮 GPU 训练复现了论文中的 6 项发现,随后自我进化出 18 个优化方案,使 AIME24 测试成绩提升 2.7 分。代码 Agent 的竞争焦点不再是单次 Prompt 的生成质量,而是模型在持续数天的反馈回路中自我修正的能力。

在 Tianchi 举办的 WWW2025 多模态意图识别竞赛中,Qwen3.8-Max 面对 526 支人类专业团队,在 24 小时限制内完成 45 次提交,准确率由 0.60 提升至 0.853,击败了 87% 的人类队伍。模型自主完成了 BERT 与 RoBERTa 的微调集成、Qwen2.5-VL-7B 特征抽取以及加权投票策略。在密集的竞赛环境下,模型展现出了快速拟定工程方案与并行验证的高效决策能力。

复杂业务场景的端到端执行

硬件设计领域的自动化探索展示了模型处理高维度工程约束的能力。在 GCD/RSA 加密硬件加速器的开发中,Qwen3.8-Max 经历了 500 轮自主优化,将 RTL 逻辑门数量从 8,298 个减少至 678 个。物理布局面积缩小 81%(从 106×106 µm² 缩至 46×46 µm²),布线长度从 33,369 µm 缩短至 4,187 µm,并达成了 500 MHz 的时序收敛(timing closure)。物理约束苛刻的 EDA 领域证明,长周期多目标优化能够有效接管复杂的传统规则系统。

商业模拟测试 E-Commerce Bench 涵盖了 365 天的仿真电商运营,包含 12 种店铺、60 个品类与 7,000 种商品。Qwen3.8-Max 经过 2,000 多轮交互后实现 4.16 倍资金回报,期末余额达到 416,252 元,相比 Qwen3.7-Max 提升 152%,超越 GLM 5.2 达 38%。运营过程中模型还识别出 152 个潜在的欺诈商户。在大规模状态空间与高动态环境中,保持长达数千轮的策略一致性已成为顶级模型的标准水准。

在量化金融研发测试中,模型将 6 条基础因子描述衍生为 50 个研究方向,调度约 330 个子 Agent 执行了 6,000 次策略回测,最终取得 0.64 至 1.48 的超额夏普比率(Sharpe Ratio)。在合规法律分析与数字银行 UI 原型设计等工作流中,模型同样实现了一小时内梳理 1,284 条法规条款或零轮修改交付原型。多 Agent 协同分工的模式极大地压缩了复杂工程任务的时间周期。

RL 训练规模与工作 benchmark 得分关系图 图:RL 训练规模与工作 benchmark 得分关系图。来源:qwen.ai 官方博客

算力扩展与统一验证器演进

支撑 Qwen3.8-Max 达成长周期自主运行的核心在于强化学习范式的演进。团队联合扩展了强化学习的环境多样性与训练算力规模,确立了环境宽度(breadth)、可靠奖励机制(reliable reward)与训练稳定性(stability)三项技术支柱。强化学习不再仅用于拟合人类偏好,已演化为提升模型复杂推理与纠错能力的主力引擎。

在模型架构内部,开发团队引入了统一验证器,涵盖基于代码运行结果的执行检验(execution-based)、规则判定(rubric adjudication)与 Agent 巡检(agentic inspection)。多维度的校验机制遏制了长链路推演过程中的错误累积,确保模型在数以千计的连续步骤后依然紧扣初始目标。长链路 Agent 的可靠性来源于多层验证体系对错误扩散的严格管控。

在生态适配方面,QwenCloud API 开放了北京、新加坡与弗吉尼亚等多个接入节点,全面兼容 OpenAI Responses 与 Anthropic API 接口协议。官方原生支持 Claude Code、Codex、Qoder、OpenClaw 等主流工具 Harness。标准化的 API 协议与泛化的生态兼容,降低了企业将 Max 级 Agent 整合进既有开发管线的成本。

重新定义 AI 战场的竞争规则

Qwen3.8-Max 的开源,其影响超越了单一技术指标的突破。它宣告了开源社区在 2.4 万亿参数的极高体量上,获得了与最顶尖闭源模型正面抗衡的基座。开源体系在旗舰级能力上的补齐,改变了大模型产业的技术供给格局。

以前行业习惯依赖 MMLU 或 SWE-bench 等单次评测分数衡量模型高下,但 Qwen3.8-Max 用 16 天持续代码提交与 500 轮芯片优化给出了新的参照系。大模型的核心竞争维度正从单次 Prompt 的智能表现,转向模型在复杂工程中自主运行的时长。

当开源模型能够在长周期、高复杂度的真实工程中提供稳定输出时,闭源技术壁垒的技术优势将受到持续挤压。未来大模型领域的胜利者,不再取决于谁先展示令人惊叹的 Demo,而在于谁能够让 Agent 在真实的生产环境中不间断地干得更久。

参考链接:

  • qwen.ai 官方博客
  • Tianchi 竞赛平台