零架构调整:后训练对 Agent 能力的杠杆重构
2026 年 7 月 31 日,DeepSeek 悄然上线了 DeepSeek-V4-Flash 的公测正式版 API,调用模型名称维持 deepseek-v4-flash。在模型架构与激活参数量保持原样的前提下,这个仅靠重做后训练(Post-Training)改造的模型,在 9 项 Agent 与代码评测中全面超越了自家规模更大的 V4-Pro-Preview。大模型竞争的主战场正在发生转移:前沿智力的边际突破成本急剧攀升,而 Agent 能力与极低价格的组合正在成为当下效能最高的性能杠杆。
官方团队在发布公告中明确声明,V4-Flash-0731 完全继承了 Preview 版本的稀疏混合专家(Sparse MoE)架构与规模,拥有 284B 总参数与 13B 激活参数。在基座模型参数冻结的条件下,通过重新设计后训练中的强化学习与轨迹微调策略,模型实现了 Agent 场景下的跨越式提升。 这印证了工程团队的判断:预训练决定模型的知识底座上限,而后训练专门的推理与工具调用轨迹优化,直接决定了模型在真实开发环境中的任务完备率。
图:DeepSeek-V4-Flash-0731 与各主流模型 Agent 评测对比。来源:officechai
这次更新仅覆盖 Flash API,V4-Pro API 与网页端保持不变,官方标注 Pro 正式版随后发布。随着 2026 年 7 月 24 日旧版 deepseek-chat 与 deepseek-reasoner 名称的正式停用,DeepSeek 正加速将全线产品向 V4 架构转移,形成以高性价比 Flash 占领 Agent 终端、以 Pro 锚定算力极限的工程矩阵。
9 项基准全面翻盘:从 DeepSWE 到 Terminal Bench
在官方披露的 9 项 Agent 与编程评估集测试中,V4-Flash-0731 展现出超越 V4-Pro-Preview 的成绩。在衡量长程软件工程能力的 DeepSWE 评测中,V4-Flash-0731 取得了 54.4% 的解决率,而之前的 Flash Preview 仅为 7.3%。从 7.3% 到 54.4% 的剧烈跨越说明,在涉及复杂代码库巡检与多步修复的重度工程场景中,后训练直接决定了模型是否具备工程实用价值。
在更加侧重终端命令行交互与系统级调度的 Terminal Bench 2.1 评测中,V4-Flash-0731 拿到了 82.7 分的高分。这一数据跨越式超越了 V4-Pro-Preview 的 72.1 分与 Flash Preview 的 61.8 分,同时逼近了顶级闭源模型 Opus 4.8 的 85.0 分。在 Shell 脚本生成与错误回溯这类单任务终端场景下,13B 激活参数的模型已经摸到了闭源前沿模型的性能门槛。
图:DeepSeek 官方发布的 9 项 Agent 评测数据表。来源:deepseekv4pro.com
在其他维度的评估中,模型同样保持高位输出:NL2Repo 达到 54.2,Cybergym 拿到 76.7,Toolathlon verified 拿到 70.3,Automation Bench (Public) 得分为 25.1。在挑战逻辑推理极限的 Agent Last Exam 中,V4-Flash-0731 取得 25.2 分,与 Opus 4.8 的 25.7 分仅差 0.5 分;在内部测试集 DSBench-FullStack 上得分 68.7,高于 Preview 的 37.0,DSBench-Hard 上得到 59.6。数据表明,经由高质量 Agent 轨迹微调后,中等量级的模型能够显著收敛工具调用的决策树衰减。
Pareto 前沿突破:以 $0.14 价格对垒闭源旗舰
性能跃升的同时,DeepSeek 依然维持了其标志性的价格优势。V4-Flash-0731 的未命中缓存输入价格为 $0.14/M token,缓存命中价格低至 $0.0028/M token,输出价格则为 $0.28/M token,并支持最高 4096 的高并发调用。这种高并发与千字分厘的成本结构,直接降低了开发者在自治 Agent 中进行深度思考与多轮试错的经济门槛。
在第三方评测机构 Artificial Analysis 的综合榜单中,V4-Flash-0731 的 Intelligence Index 提升至 50 分,比 4 月发布的 V4 Flash 提高了 10 分,比 V4 Pro 高出 6 分,仅比 GPT-5.6 Luna (max) 的 51 分低 1 分。它直接落在了 Artificial Analysis 智力与任务成本的 Pareto 最优前沿曲线上。
即使在 OpenAI 针对性将 GPT-5.6 Luna 降价 80% 的竞争压力下,DeepSeek 的单任务综合成本依然比 GPT-5.6 Luna (max) 低约 60%。在拥有 1M token 上下文窗口与 384K 最大输出能力的加持下,开发者得以用极低成本部署需要频繁读取庞大上下文的长期运行 Agent,改写了自动化运维与代码重构的算力账目。
终端开发入口之争:原生 Responses API 适配 Codex
与 API 性能升级同步到来的,是 DeepSeek 针对开发生态的接口级适配。V4-Flash-0731 原生支持 Responses API,并在发布时成为 DeepSeek 旗下唯一提供完整文档化 Codex 适配的模型。通过一套统一配置,开发者可以直接在 Codex CLI、ChatGPT 桌面客户端以及 VS Code 拓展中无缝接入该模型。
这一策略揭示了开源厂商抢占开发者终端入口的清晰路径。标准化的 API 规格降低了跨平台工具链的集成阻力,使得第三方客户端无需二次封装即可调用高性价比的推理能力。对使用 Codex 这类编码 agent 的团队来说,从 Chat Completions 兼容层迁到原生 Responses API,少了一层协议转换的摩擦。
然而,社区同样存在不同的声音。部分开发者指出,虽然 V4-Flash 在合成 benchmark 上表现突出,但在面对未在训练集中出现的私有代码库与非标准 API 时,模型依然可能出现过度的命令行尝试与长尾误判。这种争议体现了工程界对自动化工具的真实审视:合成基准测试的高分代表了上限,而复杂边界条件下的确定性才是基础设施落地的检验标准。
竞争规则演变:Agent 效能与价格双轮驱动
DeepSeek-V4-Flash-0731 的公测上线证明,大模型行业的效能迭代并不完全依赖于千亿级算力的预训练堆叠。在保持 284B 总参数与 13B 激活参数架构不变的前提下,仅仅通过重构后训练阶段的数据流与强化学习目标,就能将小规模模型的 Agent 能力提升至比肩旗舰闭源模型的水平。
这种工程范式的胜利,将市场竞争焦点拉回到算力效率与部署成本的现实账面。在 $0.14/M token 的极低门槛下,开发者的关注点正从单纯追求单个 Prompt 的回答质量,转向构建能够自我纠错、高频调用的自动化 Agent 系统。
当前沿厂商依然在为通用智力的微弱提升付出指数级增长的训练成本时,通过精准的后训练杠杆将 Agent 实用性带入开发工作流,正重新定义大模型落地生产力的工程标准。下一步的悬念在于:即将到来的 V4-Pro 正式版,能否在更大规模的基座上继续保持这种惊人的后训练杠杆率?
参考链接: