Redis作者用C与Metal写引擎:Mac本地3.5秒生成视频

Redis作者用C与Metal写引擎:Mac本地3.5秒生成视频

MiniMaxApple SiliconantirezMetal端侧AI

数据源:HN + web research

零 Python 依赖:Redis 作者的 3.5 秒端侧实验

2026 年 8 月 10 日,Redis 创建者 antirez(Salvatore Sanfilippo)在 GitHub 开源了名为 h3.c 的全新项目。这是一个采用纯 C 语言与 Metal(Apple 硬件加速 API)构建的本地推理引擎,完全剥离了对 Python 运行时与 PyTorch 框架的依赖。项目发布仅两天时间,便收获 853 个 Star、120 次代码提交与 40 个 Fork。工程精简的极致追求吸引了大量系统级开发者参与协作。

在 M5 Max 芯片实测中,h3.c 执行 512x512 分辨率、22 帧、4 步降噪的视频生成任务仅需 3.5 秒,50 步全采样渲染则耗时 26.4 秒。这一速度达到了基于 Apple MLX(机器学习阵列框架)Python 实现的同等水平。无解释器开销的纯系统级代码大幅降低了软硬件部署门槛,使复杂的多模态生成能够脱离重量级计算环境独立运行。

自 2024 年从 Redis 维护工作退休后,antirez 将研发重心转向大语言模型端侧推理领域,此前曾开发过基于纯 C 语言的大模型推理项目 lms.c。此次针对 MiniMax H3 的工程重构延续了其一贯的极简主义风格。项目在支持文本驱动视频与音频生成的同时,完整打通了首尾帧条件控制(FL2VA)以及基于图像、视频和音频的参考生成(Ref2VA)管线。

许可壁垒外的管道:当开源权重遇到本地 C 引擎

MiniMax 于 2026 年 7 月 31 日正式发布多模态生成模型 MiniMax H3,具备 2K 分辨率、15 秒视频生成及原生立体声合成能力。虽然云端 API 定价压到了主流竞品的 1/3 以下,但其开源权重使用许可明确排除了美国与欧盟区域的商业及云端部署。这种政策约束给欧美开发者在合规使用方面蒙上了阴影。

离线运行的本地代码无需依赖任何云端 API 交互,绕过了服务端的地理围栏限制。当开源权重文件在 Hacker News 社区快速扩散时,运行于个人 Mac 终端的纯 C 引擎构成了欧美开发者体验与研究中国顶尖生成模型的实际通道。 硬件层面的离线执行保证了业务数据隐私,同时也赋予了开发者不受监管接口影响的掌控力。

这一现象印证了开源权重与本地极简引擎结合后应对区域技术隔离的特殊韧性。一旦模型权重在公共网络完成扩散,基于开源协议的本地代码就能在几小时内重构整个计算链路。极简底层工程削弱了中心化云服务提供商的控制力,重新定义了全球开发者获取前沿 AI 能力的路径。

算力拆解:如何在 M5 Max 上把 16.69 秒压到 12.60 秒

在多模态 Transformer 模型的本地计算优化中,antirez 引入了 Token Reduction(标记削减)策略。在包含 45 层 Transformer 并开启 2 倍复用率的降噪流程中,该技术将单次计算耗时从 16.69 秒直接压缩至 12.60 秒。这一优化显著降低了高分辨率帧渲染时的矩阵乘法负载,释放了 Apple Silicon 共享内存架构的带宽潜能。

为进一步突破存储带宽瓶颈,h3.c 提供了 --use-int8-row-fc2 的行级 8 位整数量化选项。实验测量表明,在 4 步降噪配置下,对比 29 步基准渲染,生成的狐狸(fox)与冲浪者(surfer)示例结构相似性指标(SSIM)分别为 0.556 和 0.547。启用行级量化后,SSIM 指标依然保持在 0.919 与 0.828 的高位。精细的行级量化粒度成功在矩阵吞吐效率翻倍的同时,维持了时空生成的视觉连贯性。

下图展示了 MiniMax H3 官方博客公布的生成画质表现。在端侧代码极致优化的加持下,开发者得以在个人硬件上体验接近云端集群的生成质感。

MiniMax H3 官方示例生成图 图:MiniMax H3 官方示例生成图。来源:minimax.io 官方博客

极简主控逻辑:垂直切片与确定性元数据

在架构设计上,h3.c 坚守确定性的 Host/Model Metadata(主机与模型元数据)优先原则,采用垂直切片方式推进功能打通。整套引擎涵盖了 H3-VAE(变分自编码器)、H3-Omni Transformer 以及 In-Context Regeneration(上下文重生成)三大核心组件。作者通过 --reuse--core-reuse 以及 --layers 三组独立参数,为用户赋予了精确平衡生成速度与画质细节的控制权。

为了解决低分辨率快速预览时的空间位置编码偏移问题,h3.c 内置了 256 分辨率原生预览模式,并能自动动态调整空间 RoPE(Rotary Position Embedding,旋转位置编码)。系统级代码免去了 Python 深度学习框架中复杂抽象带来的不确定性,使端侧调试过程更加透明。 这种底层掌控力使开发调试过程更加高效。

下图为 MiniMax H3 发布时的官方主视觉图,揭示了该模型跨模态统一生成的架构企图。antirez 用极其凝练的 C 语言重新诠释了这种复杂的算法结构。

MiniMax H3 发布主视觉 banner 图:MiniMax H3 发布主视觉 banner。来源:minimax.io 官方博客

边际成本降维:个人终端对云端计算管线的侵蚀

传统的视频生成模型长期依赖昂贵的云端 GPU 集群,按生成秒数计费的商业模式给个人开发者和微型团队带来了沉重的财务负担。即便 MiniMax 云端 API 已经打出极低售价,h3.c 的出现仍然将边际生成成本推向了另一个维度——仅需支付运行 Mac 电脑的日常电费。端侧设备在计算经济学层面展现出了强烈的替代效应。

h3.c 的工程价值超越了单纯的技术复刻,标志着中国开源多模态权重与本地底层推理范式的结合落地。当底层极简代码与终端统一内存结合时,视频生成的边际成本演进路径已经被深刻改变。 终端设备的硬件潜能正被重新激活,云计算对前沿大模型算力通道的垄断格局正在面临深刻拆解。

参考链接:

  • antirez/h3.c GitHub 开源项目仓库
  • MiniMax H3 多模态模型发布博客
  • explainx.ai 关于 MiniMax 开源许可分析报道