软件没有理由再慢:AI把性能验证降至分钟级

软件没有理由再慢:AI把性能验证降至分钟级

性能优化AI Coding系统工程Dan Luu

数据源:HN + web research · HN

验证成本才是决定软件速度的本质瓶颈

2026 年 8 月 21 日,系统工程师 Dan Luu 发布了一项针对软件性能优化成本的深度实验。他指出长期制约软件运行速度的本质瓶颈,源于工程师验证某项优化所需的时间开销。当验证一项复杂改动的人工开销从数个工作日暴跌至 2 分钟,整个软件性能优化的决策门槛被彻底改写。

在传统软件开发流程中,为特定工作负载打磨专用优化通常需要极高的人力投入。绝大多数项目只能依赖通用编译器与标准库,被迫承受通用化设计带来的性能让步。Coding Agent 的引入重塑了这种投资回报比,当验证一项棘手优化的边际成本趋近于零,为特定工作负载定制软件从大厂特权退变为全民可选的工程实践。

2分钟超越通用引擎:工作负载定制的威力

Dan Luu 在其个人机器上收集了一个月的 codex 历史查询数据,发现其搜索行为具备极强的特定偏置。测试数据显示,其 ripgrep 查询模式的长度中位数为 55 个字符,p90 达到 119 个字符,且 94% 的正则表达式在历史记录中仅出现过一次。通用搜索引擎必须假设更平均的字符串分布,而特定工作负载的偏置特征为重写定制匹配算法留出了空间。

Dan Luu 机器上 ripgrep 查询模式长度分布 CDF 图:Dan Luu 机器上 ripgrep 查询模式长度分布 CDF。来源:danluu.com

在拿到这段历史查询数据后,Coding Agent 仅用时 2 分钟便生成了定制优化分支,并在保留的 holdout 测试集上实现了比标准 ripgrep 快 2% 的加速。即便是面对被人类工程师极其精细打磨过的基础设施,针对固定模式的代码重写依然能挤出额外性能。通用基础设施由于需要兼顾所有可能的数据分布,注定无法在单一特定场景下触及效率极限。

在 FRE 正则引擎的编译改造实验中,Agent 被指定完成从解释执行到原生 AOT 编译以及后台热替换的架构重构。在仅需数分钟人工干预的情况下,原生 AOT 编译为长查询带来了 2 倍至 4 倍的加速,全局 holdout 查询上也取得了约 7% 的平均提升。过去需要高级系统专家花费数周构建的动态编译架构,现在可以在分钟级的人时投入下完成原型探索与验证。

探索空间被压平:领域专家的经验壁垒正在失效

在桌面棋盘游戏 Azul 的 AI 开发实验中,Dan Luu 在缺乏博弈 AI 专业背景的前提下借助 Agent 构建算法。该项目构建的 AI 在实际测试中大幅击败了社区现有的最强方案,其计算速度每提升 2 倍便能换取约 100 Elo 天梯分的上涨。整个开发耗时相比传统人工打磨缩减了两个数量级,且全程在单台笔记本电脑上跑通,改变了重度依赖算力集群的传统玩法。

ripgrep 命令耗时分布 CDF 图:ripgrep 命令耗时分布 CDF。来源:danluu.com

同样的范式转移也在 Anthropic 的性能测试中得到了重现。工程师 Jamie Brandon 在评估 Claude 处理性能优化任务时发现,Agent 不仅快速试遍了他预想过但无暇执行的思路,还探索了需要花费数周试错的高风险变体。在有界且可验证的优化空间内,人类工程师凭借经验进行假设检验的效率很难赶上 Agent 的高频迭代速度。

AWS 首席技术官 Marc Brooker 与 pgrust 作者 Michael Malis 针对这一现象展开了深入探讨。系统工程领域过去缺乏专用 JIT 编译器,核心障碍在于构建与维护这些复杂编译器的工程开销过于昂贵。当 Agent 将性能验证的人力时间压缩了 1000 倍到 1000000 倍时,阻碍软件变快的主要矛盾正式从代码编写能力转向了测试集评估设计。

过度拟合与环境跃迁:自动化定制的风险边界

虽然代码定制展现出巨大的效率潜力,但工作负载过度拟合(Workload Overfitting)构成了不可忽视的工程隐患。在 FRE 正则引擎优化初期,Agent 迅速将逻辑拟合到了测试用的 rebar 仓库模式上,直至人类引入严格的 holdout 评估集才促使其恢复通用泛化能力。如果缺乏科学严谨的评估集隔离,自动化优化极易陷入针对局部测试集刷分的黑盒陷阱。

环境跃迁(Regime Change)则是另一道隐藏在数据背后的隐形暗礁。当真实生产环境的数据分布发生剧烈偏移时,过度依赖历史工作负载微调的代码可能遭遇性能骤降甚至执行异常。工程师在享受动态代码定制红利的同时,必须将更多工程精力投入到分布式监控与自动化回滚机制的建设中。

软件无理由再慢:经济学决策引发的工程演进

软件之所以长期维持在不够快的状态,根本原因在于绝大部分性能优化的投产比算不赢工程师的高昂薪资。Dan Luu 的一系列实验证明,当 Coding Agent 将单次优化的美元成本降低约 1000 倍后,这一经济学枷锁被彻底打破。原本由于收益微小而被归入低优先级的优化需求,在全新的成本曲线下重新获得了被执行的理由。

软件工程的未来竞争将从通用框架的争夺,转向对特定工作负载定制能力的掌控。当定制一套高性能专用引擎的门槛降至几分钟,软件没有理由继续在通用化的妥协中忍受低效。决定软件性能上限的关键,在于能否为 Agent 提供真实且不偏置的性能评估基准。

参考链接:

  • danluu: There’s no reason for software to be slow anymore
  • Hacker News 社区讨论