14天将数学计算提速232倍:AI能通宵跑代码,但搞不定选方向

14天将数学计算提速232倍:AI能通宵跑代码,但搞不定选方向

AI自动研究GPU内核代码优化

数据源:sankalp bearblog + HN

183名高手里的AI黑马

在 183 名开发者角逐的顶级 GPU 内核优化赛场上,排在前列的选手几乎清一色是英伟达的首席工程师。然而获得第 12 名的开发者 sankalp,掌握 GPU 编程基础不过刚好一年。他在 14 天比赛中拿到优异成绩的武器,是让大语言模型 Codex 在后台跑完 1500 多次「测试-分析-修改-验证」的自主循环。

这场竞赛的题目是实现批量方形紧凑 Householder QR 分解。这项矩阵运算在底层计算中十分关键,比如大语言模型优化算法 Muon 与 Kimi 的训练过程都在使用相关技术。

1500次自动提交:给AI挂上无人驾驶自动挡

为了让 Codex 实现自主进化,sankalp 为模型搭建了一套无死角的性能评测与分析框架。在此基础上,Codex 在 14 天赛程中进行了超过 1500 次代码提交,测试基准从初始的 torch.geqrf(耗时约 419,000 微秒,初始内核基准为 108,803 微秒)一路缩短至最终的 1,805 微秒,最终实现了 232 倍的性能提升。

sankalp 只需要每隔 2 到 3 小时使用不会打断执行流的轻量提示词检查一次方向,甚至可以让模型在夜间完全无人监督地持续运行。这说明大语言模型具备强悍的代码生成能力后,只要搭配完善的自动化评估套件,就能独自承担极其繁重的底层代码迭代与长程测试。

Codex 自动化迭代过程日志 图:Codex 在后台自主运行基准测试与性能剖析日志。来源:sankalp.bearblog.dev

瓶颈转移:AI为什么会在1800微秒前卡壳

Codex 在优化过程中展现出了清晰的结构进化轨迹。代码经历了从初始 torch.geqrf 到分块 WY QR 算法,再到使用 Triton 面板、Cholesky-ORHR 替换、CUDA graph 绑定、融合装配、split16 面板、固定形状特化,最终演化为超面板与自定义 Cholesky 的复杂组合。

Codex 内核优化 10 步结构进化 图:内核优化从 108,803 微秒降低至 1,805 微秒的 10 步算法结构进化过程。来源:sankalp.bearblog.dev

然而随着耗时压低到 3000 微秒至 1800 微秒区间,单纯依靠计算指令微调已经无法产生突破。此时优化的核心瓶颈不再是硬件的计算能力或内存带宽,而是转移到了显卡调度开销(launch overhead)与面板开销(panel overhead)。

在这个关键节点,Codex 开始陷入典型的局部最优陷阱。模型在现有的代码结构里反复做小修小补,连续几十次迭代都没有带来实质性的速度提升。在笔者看来,当优化进入底层调度机制的深水区时,大模型的随机搜索机制很容易在次优解的困境里死磕。

候选束决策:人类在分叉路口的导航术

为了打破这种僵局,sankalp 调整了给 AI 的指令策略。他引入了「候选束(beam of candidates)」机制,要求模型同时保留 3 到 5 个不同算法家族的候选分支,防止一次编译报错就彻底放弃某个潜在的技术路线。

作者与 Codex 循环对话截屏 图:开发者通过引导式对话调整 Codex 的算法优化搜索方向。来源:sankalp.bearblog.dev

在这种引导下,Codex 被推向了全新的算法方向,成功采纳了 Cholesky-ORHR 架构与超面板优化。人类开发者的经验价值在于,当模型在局部搜索中停滞不前时,能够凭借对领域知识的理解强制要求 AI 进行范式转移。这种算法层面的方向决策,构成了突破微秒级瓶颈的真正决定力。

社区镜像:全自动背后的真实成色

类似的自动化研究试验在技术社区中也有所回应。开发者 Almondsetat 使用 DeepSeek v4 对视频编解码器运行自动化优化循环,仅用几小时就产出了针对 SSE 与 AVX 的并行指令实现,使单核性能直接翻倍。

另一位开发者 poizan42 依靠 Opus 5 编写 NEON 内核,在树莓派 4 上实现了 4K HEVC 视频的实时转码。但这位开发者同样坦言,整个优化过程离不开大量的人工方向操纵(steering)。

在笔者看来,这些来自不同领域的技术实践呈现出一致的规律。在大模型时代,所谓的「全自动研究」在执行层面表现出强大的效率,但依然高度依赖人类对边界和维度的把控。离了人类的方向指引,AI 很难凭空跨越算法演进的门槛。

终点属于把控方向的人

232 倍的提速成果展现了 AI 自动研究的真正体量。Codex 承担了从查阅算法论文到调试底层内核的绝大部分体力劳动,但在 14 天长跑的每一个关键节点上,人类给出的方向选择依然不可替代。

大语言模型如今能够通宵达旦地跑完代码测试,可它依然无法预知哪一条算法小径才能通往山顶。在技术探索的前沿,AI 是脚踏实地的执行者,而人类依然是手握罗盘的领航员。

参考链接:

  • sankalp BEARBLOG 博客文章
  • HN 社区讨论 (item?id=49309549)