iPhone 实测 127 tok/s:DeepGrove 三元模型打破后量化神话

iPhone 实测 127 tok/s:DeepGrove 三元模型打破后量化神话

端侧AI开源模型三元权重DeepGrove

数据源:HN + web research

2026 年 8 月 5 日,DeepGrove 在 Hacker News 上开源了 20B 规模的语言模型 Maple-Preview。这个拥有 20.2B 总参数的模型被压缩至 5.31GB 权重大小,在 iPhone 上实现了每秒 127 个 token 的生成速度,比同规模的 1-bit Bonsai 27B 快了 13 倍。这种性能飞跃源于训练阶段的架构重构,而非事后剪枝量化的妥协。

长久以来,工业界将大模型推向手机的通用做法,是先在 FP16 或 FP8 精度下完成全量训练,再通过事后量化强行压缩至 4-bit 或 2-bit。DeepGrove 提出了截然相反的观点:「模型在什么精度下学习,就应该在什么精度下运行」。Maple-Preview 验证了原生低精度训练在端侧设备上的巨大工程红利,同时也拉开了端侧 AI 从「后量化裁剪」向「原生高效架构设计」演进的序幕。

原生三元架构:加法运算取代矩阵乘法

Maple-Preview 的核心突破在于彻底弃用了高精度的浮点乘法。其权重仅由 {-1, 0, +1} 三个离散值构成,使得模型在执行 Transformer 层的矩阵运算时,原本高耗能的向量点乘直接退化为简单的整型加减法。这种算术层面的化简,让芯片的张量计算单元负担大幅降低。

硬件实测数据证实了这种算术退化的物理优势。在 16GB 内存的 Mac mini M4 上,Maple-Preview 的推理速度达到了每秒 218 个 token;而在 MacBook Pro M5 Pro 平台上,其生成速度飙升至每秒 281.5 个 token,并成功完成了 IMO 2024 P1 数学竞赛题目的完整推理。单台消费级设备在低功耗状态下维持超高吞吐,说明加法替代乘法直接重塑了端侧推理的能效比。

Maple-Preview 速度与质量前沿对比 图:Maple-Preview 在 16GB M4 Mac mini 上的速度-质量前沿图。来源:DeepGrove 模型卡

这种极端的算术简化也给硬件调度带来了全新契机。在传统 GPU 或 NPU(Neural Processing Unit,神经网络处理器)架构中,浮点乘加单元占据了大部分芯片面积与功耗。三元权重将计算瓶颈从算术逻辑单元转移至内存带宽,使常规移动端芯片得以释放出数倍的计算潜能。

硬件感知的全链路设计:反哺参数调度

DeepGrove 在模型微观结构的设计上采用了以硬件反馈为导向的迭代策略。初始设计的 Maple-Preview 拥有 30 层网络与 224 个专家,但在 Mac mini 上的实测性能未达预期。研发团队根据硬件指令流水线的实际吞吐,将结构调整为 24 层网络与 256 个 MoE(Mixture of Experts,混合专家)专家。

在调整后的 MoE 架构中,20.2B 的总参数量每次前向传播仅激活 1.49B 参数。这种高稀疏度设计使得 5.31GB 的模型权重可以在有限的内存空间内快速加载。这种通过端到端硬件实测反哺架构参数的搜索过程,构成了工程优化的核心。

Maple-Preview 基准测试对比 图:LCBv6、AIME 2026、HMMT 2026 和 GPQA-D 基准对比图。来源:DeepGrove 模型卡

为了在移动端支撑长文本推理,Maple-Preview 引入了滑动窗口与全局注意力机制交替的混合注意力架构。在高达 131,072 个 token 的上下文长度下,键值缓存(KV cache)的内存占用增长被有效压制。端侧模型的设计循环不再依赖理论 FLOPs 评估,而是通过真实的硬件运行反馈驱动架构演进。

Maple-Preview 上下文内存占用对比 图:131K tokens 上下文的内存占用对比图。来源:DeepGrove 模型卡

硬核推理跑分:小激活参数摸到前沿门槛

在涵盖 LCBv6、AIME 2026、HMMT 2026 与 GPQA-D 的综合基准测试中,Maple-Preview 取得了 78.7 分的平均成绩,其 Flash 版本亦达到 77.7 分。这一表现超越了同级别的 Ternary Bonsai 27B(77.1 分)、Qwen3 30B-A3B(76.6 分)以及 GPT-OSS 20B(76.3 分),并逼近了 GLM 4.7 Flash(77.4 分)。

以 1.49B 的激活参数输出媲美 30B 级模型的数学与代码推理能力,证明了三元权重能够较好地保留逻辑链条的完整性。DeepGrove 在模型卡中明确指出,预览版本当前将所有算力集中于原始推理能力(raw reasoning),在复杂 Agent 交互任务上的表现仍需后续调优。

Maple-Preview 证明了原生低精度训练无需牺牲核心逻辑推导能力,在定点数学与符号计算上具备极高能效。 这种在逻辑密集型任务上的高分表现,为端侧小模型的专业化应用提供了有力支撑。

知识密度的物理困境:小模型的幻觉边界

然而,Maple-Preview 在社区测试中暴露的短板同样引人深思。Hacker News 用户 walrus01 在测试中要求模型撰写关于词汇 etymology(词源)的 250 字短文,Maple-Preview 输出了极其自信但完全错误的解答,而 Qwen3.6 35B 则给出了标准答案。这一实验凸显了小模型在通用知识储备上的物理局限。

社区讨论中,hrmon 指出仅解压后的英文维基百科文本就高达 24.7GB,要求一个 5.31GB 的模型兼顾逻辑推理与百科全书式的知识检索极不现实。开发者 sajithdilshan 与 brainless 提出,端侧小模型应当采取防御性应答策略,在遭遇未确证知识时主动发起工具调用或联网搜索,而非盲目硬答。

此外,用户 SwellJoe 关注到 DeepGrove 提出的 dreaming(端侧自适应调权)概念,即利用极简的三元数学结构在设备空闲时进行本地增量微调。但他同时表达了对自适应学习稳定性的隐忧,防止模型在离线演进中产生偏见累积。HelloUsername 则强调,端侧模型的根本价值恰恰在于离线环境下的隐私保护与可用性。

知识存量与推理逻辑在超低位宽下的解耦,决定了端侧模型的定位是高效率的算力节点,而非全知全能的口袋百科。 这种物理层面的限制,要求未来的端侧应用必须依赖良好的外部工具协同。

端云分工的重新界定

Maple-Preview 的意义不在于它是否能在通用知识上击败云端大模型。它的核心价值在于展示了一种可能性:从训练源头原生构建低精度架构,能够把 20B 规模模型的推理延迟推至毫秒级。加法网络与硬件感知的 MoE 结构,共同勾勒出端侧 AI 架构演进的新路线。

当移动芯片每秒能够吐出 127 个 token 时,端侧 AI 竞争的主战场已经从「如何把大模型塞进手机」转向「如何为手机量身设计原生模型」。尽管知识密度决定了它无法独自回答所有领域细节,但通过端侧高速逻辑与云端海量知识的有机配合,端侧计算的新边界正在被清晰地划定。

参考链接:

  • DeepGrove 发布 Maple-Preview 模型卡
  • Hacker News 社区关于 Maple-Preview 的讨论
  • IMO 2024 P1 解题基准测试报告