104GB 的模型权重,在 48GB 内存的 Mac 上跑出了每秒 12 个 token 的推理速度。这种违背经验常识的空间越级,直接源自阿里通义千问在 2026 年 8 月开源的 Qwen3.8-Flash-Next 架构。它把参数规模和激活成本实质解耦,让 SSD 流式本地推理成为端侧设备的现实方案。
125B 总参只激活 6B
Qwen3.8-Flash-Next 是一次 Qwen4 架构的提前演练,也为本地推理提供了一套新的资源分配范式。根据官方模型卡公布的账本,这个模型拥有 125B 的总参数量,但实际激活参数只有 6B。对比同为前沿开源模型的 DeepSeek-V4-Flash-0731,其 284B 的总参数需要激活 13B,而 Qwen 自家上一代的 Qwen3.7-Plus 则是 397B 激活 17B。
悬殊的总参与激活参比例,在运行时卸下了绝大部分计算负担。设计团队将多达 51B 的参数分配给了 N-gram embedding,这种结构比传统的混合专家模型(MoE)进一步缩减了计算量。大模型的能力边界不再死死绑定物理显存的上限。
这种资源重组的思路,直接为终端设备的低显存运行铺平了道路。参数规模依然在支撑着模型广阔的知识域,但推理时的硬件压力被精准地控制在了 6B 这个微小的切口里。
图:Qwen3.8-Flash-Next 官方架构图。(来源:HuggingFace Qwen 模型卡)
104GB 模型挤进 48GB 内存
参数结构的稀疏特性,立刻在终端硬件上引发了连锁反应。在 Hacker News 上引发热议的开源项目 slotstream 给出了确凿的实证:这 125B 参数的 MoE 模型不仅能在消费级设备上跑,还能维持高可用性。在 48GB 内存的 Mac 上运行 103.8GB 的 4bit 量化模型,常驻内存只需要 3.8GB。
由于解码路径上真正必须的权重很少,高达 51B 的 embedding 和大量的 MoE 专家权重可以常驻在 SSD 中,仅在计算时按需读取。这套组合拳甚至能让 8GB 内存的入门级 Mac 维持每秒 3 个 token 的输出。系统的吞吐瓶颈被成功从显存空间转移到了硬盘带宽上。
这套方案基于 MLX 引擎采用单 Swift 二进制构建,抛弃了繁重的 Python 依赖。它内置了投机解码功能,通过 draft head 预测下一个 token 达到 86% 的命中率,将实测速度从 10.1 tok/s 提升到了 11.8 tok/s。在 1Gbps 的网络下,用户只需 16 分钟就能拉完 104GB 的模型权重,部署链路变得非常紧凑。
架构设计向终端硬件让路
将百 GB 级模型塞进小内存的成果,绝不仅仅是外围工程的功劳。Qwen3.8-Flash-Next 从算法根源上就把硬件的物理限制纳入了考量体系。它把 Gated DeltaNet 与 Gated Attention 结合,改造成全新的 QSA 混合注意力机制,并将稀疏粒度细化到 micro-block 级别,直接压低了长上下文处理的延迟。
除了在残差流上引入细粒度的读写门控机制,官方技术报告中明确说明,N-gram embedding 的设计初衷就是为了内存受限的加速器。这种用短 n-gram 做索引来扩展参数的方法,天生适合在固态硬盘上做换页与流式加载。
算法模型在设计阶段就开始向终端设备的物理限制靠拢。硬件不再被动地去填补算法留下的算力黑洞,而是算法主动重构自身以适应消费级硬件的带宽特征。
图:模型卡多模态输入示例。(来源:HuggingFace Qwen 模型卡)
重构训练配方换取效率
在训练层面,Qwen3.8-Flash-Next 展示了对工程效率的把控。团队将 Muon 与 AdamW 优化器按权重类别进行分区使用,打破了传统的统一优化策略。借助重拟合的 scaling law,模型在训练时直接跳过了 batch-size 的预热环节。
这种专项优化大幅减少了优化器的步数,并支撑起了更大的学习率。在多模态生态上,官方的 image-text-to-text 流程默认开启了 thinking 模式。生产版的 Qwen Cloud 更是直接提供了 1M 的上下文支持并深度集成了内置工具。
这些底层设计的改造,最终都服务于一个明确的目标。用更小的实时代价撬动更复杂的逻辑推理,无论是在云端集群还是本地机器上,这套思路都展现出了显著的资源优势。
专项成绩单反超全能巨头
为了适配硬件而砍掉激活参数,并没有让模型在实际任务中付出性能代价。在难度极高的 Agentic coding SWE-bench Pro 上,Qwen3.8-Flash-Next 拿下了 62.5 的成绩,超过了 Claude-Opus-4.6 (Max) 的 53.4 和 DeepSeek-V4-Flash-0731 的 56.0。在侧重特定能力的 JobBench 测试中,它更是以 55.7 的分数拉开了十多分的差距。
| 测试项目 | Qwen3.8-Flash-Next | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) |
|---|---|---|---|
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| JobBench | 55.7 | 41.3 | 36.6 |
| DeepSWE 1.1 | 58.7 | 54.4 | - |
| NL2Repo-Bench | 48.1 | 54.2 | - |
在 DeepSWE 1.1 的测试中,它拿到的 58.7 分远超同系列 Qwen3.8-27B 模型的 42.2 分。端侧模型不需要为了大而全去填补那些利用率低下的参数空间。针对实际任务进行的架构重构,能在特定的关键场景里击败账面参数庞大得多的闭源前沿模型。
Qwen3.8-Flash-Next 给出了一套清晰的工程解法。125B 参数的知识库被成功装进 104GB 的权重文件里,SSD 的读取延迟取代了高昂的显存成本。一条单一的二进制程序让百 GB 级模型在 48GB 内存中跑出可用速度,本地端侧推理的算力准入门槛就此被大幅压低。
参考链接:
- HuggingFace Qwen3.8-Flash-Next 模型卡
- slotstream GitHub
- Hacker News 讨论
- Qwen3.8-Flash-Next 技术报告