2.8万亿参数AI塞进MacBook:每秒1个字的硬核慢思考

2.8万亿参数AI塞进MacBook:每秒1个字的硬核慢思考

Kimi大模型本地推理MacBook

数据源:HN + web research

2026 年 9 月 8 日,Hacker News 首页出现了一个反常识的技术实测。有人把月之暗面开源的 2.8 万亿参数 Kimi K3 模型,塞进了一台苹果 M5 Max MacBook Pro 里离线运行。这台笔记本只有 128GB 内存。2.8 万亿参数的模型体积远超普通电脑的物理上限。开源项目 deltafin 靠着外接四块高速固态硬盘,完成了这场蚂蚁搬大象的工程实证。

「万亿参数大模型能塞进家用笔记本」改变了大模型的成本叙事。过去五年,大模型是数据中心里的云端服务。普通人只能通过接口调用。现在,开源权重加上社区硬件工程,把「多大的 AI 才算 AI」这个问题摆到了普通用户的硬盘面前。但在欢呼之前,实测速度划出了一道物理边界。这台外接四块硬盘的笔记本,每秒只能生成 1 个字词。

128GB内存装不下2.8万亿参数

把万亿参数模型跑在本地,第一道墙是物理内存容量。参数是人工智能模型内部的旋钮。2.8 万亿个旋钮决定了模型的能力上限,也决定了它的庞大体积。按照常见的量化压缩比例,2.8 万亿参数的模型完整加载需要约 1TB 级别的内存,激进压缩后也要数百 GB。目前市面上最顶配的 MacBook Pro 统一内存也只有 128GB。

技术愿景在这里撞上了物理限制。用传统的运行方式,模型必须一次性完整塞进内存。这台笔记本连 Kimi K3 的五分之一都装不下。内存不够,常规做法是把硬盘当虚拟内存用。硬盘的速度通常比内存慢几百倍。让处理器在运算时频繁去硬盘里找数据,系统运算速度会被立刻拖垮。

传统密集型架构模型在硬盘上运行,每一次生成都需要把几千 GB 的数据全部翻一遍。这种做法在个人电脑上行不通。要跨越这道墙,必须找一种能够按需读取的机制。

四块硬盘扛起16个专家轮换

deltafin 项目能跑通,核心依靠 Kimi K3 的混合专家(MoE)架构与精巧的硬盘切片工程。K3 模型内部包含了 16 个专家模块。它们负责处理不同的任务特征。生成每一个字词时,模型不需要唤醒所有专家,往往只需激活最匹配的几个。这种机制天然适合流式按需读取。

开发者把庞大的模型按层、按专家进行切片。这些切片分散存储在四块外接的 NVMe 固态硬盘上。这种操作在数据库领域很常见,但在大模型推理中却是一场硬核的下放实验。四块硬盘并发读写,分摊了巨大的带宽压力。

推理过程变成了一场精准的调度游戏。K3_PILOT 推测读取机制在其中发挥了关键作用。每次遇到新词,程序预判下一层会用到哪个专家。系统立刻通过双路并发读取(split-homed expert reads)机制从硬盘抽数据进内存。用完后内存会立刻被释放,给后续的专家腾出空间。为了对抗硬盘读取延迟,项目统计了专家驻留热度。这个名为 expert residency heat histogram 的机制,记录了每一轮推理中专家的被点名次数。最常被激活的通用专家留在 128GB 的物理内存里。冷门专家去硬盘里排队。这种动静结合的设计,掩盖了大量的硬盘寻道时间。

Kimi K3 模型卡视觉图 图:Kimi K3 官方模型卡视觉图。来源:HuggingFace moonshotai/Kimi-K3

四块高速固态硬盘并行输出,撑起了按需调取的庞大数据吞吐量。应用层基于模型结构进行精确的数据搬运。这种工程手段在 128GB 内存的夹缝里,为 2.8 万亿参数模型开辟出一条生存通道。

每秒1个字词测出慢思考边界

把大象塞进冰箱,代价是巨大的速度牺牲。实测数据显示,在这台苹果笔记本上,两次冷启动的中位数速度稳定在 0.92 到 1.13 token/s 之间。即便加上 Qwen3-0.6B 作为推测解码器辅助预判,速度也仅在 1 token/s 上下浮动。处理 512 个字词长度的输入,速度大约是 1.4 token/s。输出内容与无推测解码模式逐字节一致。

场景与设备类型典型生成速度 (token/s)核心应用形态
云端 GPT-4 / Kimi API20 - 50+实时人类对话、网页速读交互
本地运行 8B 级别小模型30 - 60+终端离线助手、实时代码补全
Kimi K3 + MacBook 四硬盘0.92 - 1.13离线代码推演、长文逻辑草稿
人类平均阅读速度4 - 8视觉文本摄入

人类正常阅读屏幕文本的速度大约是每秒 4 到 8 个词元。坐在屏幕前等待 Kimi K3 回答时,它吐字的速度比你默读还要慢上几倍。今天基于数据中心的云端模型能轻松达到每秒数十个字词的实时对话标准。

deltafin 项目不同输入长度下的解码速度实测图 图:deltafin 项目实测图:不同输入长度下的解码速度。来源:GitHub argonautlabsai/deltafin

慢两个数量级的实测成绩,在 Hacker News 上引发了激烈讨论。一部分开发者认为这是工程奇观,这种吞吐量在人类交互层面没有实用价值。对于不需要实时交互的后台任务来说,速度慢并非致命伤。系统可以在后台花一晚时间梳理复杂的代码库。智能代理能在无需干预的沙盒里跑通逻辑。每秒 1 个字词的速度足以换取顶级推理质量。这里划出了一条清晰的边界。它做不了人类的陪聊,但可以胜任本地环境下的慢思考苦力。

大模型变成普通用户的本地文件

过去几年,人工智能的发展叙事绑定在庞大的数据中心和昂贵的云端算力上。普通开发者和用户只能向科技巨头租用算力。隐私数据必须上传云端。deltafin 把 Kimi K3 搬进笔记本的实证,展示了另一种可能。模型不再是一个只能在远端访问的服务,而是变成了一堆保存在本地硬盘上的文件数据。

2.8 万亿参数的大模型以本地文件的形态驻留在个人电脑里。它只能发挥出每秒 1 个字的慢思考能力,但这让数据隐私和离线可用性得到了物理层面的保障。企业可以在断网的环境下运行包含机密信息的推理任务,没有任何外部监听的风险。开发者能在无网环境里让顶级大模型帮自己推演架构设计稿,它变成了一个不知疲倦的本地苦力。这种工作模式不再是以对话框为主的聊天,而是以长任务为主的后台进程。

Kimi K3 的开源权重加上社区硬件工程,完成了一次概念验证。这场实验打破了万亿大模型与普通人之间的绝对隔离。2.8 万亿参数的混合专家模型在终端长程任务中离线跑通。前沿人工智能的成本叙事正式从云端训练转向了本地推理分发。

参考链接:

  • HN 讨论 (item?id=49616257)
  • GitHub argonautlabsai/deltafin
  • HuggingFace moonshotai/Kimi-K3