小模型的经济学:当十美分买到够用智能

小模型的经济学:当十美分买到够用智能

小模型AI 经济学大语言模型

数据源:Segment 联创发文 + HN 社区

一个基于上一代大模型的个性化每日新闻站,单次处理成本约 1 美元。即使向消费者收取每月 30 美元的订阅费,这笔账依然打不平。过去两年,高昂的 Token 成本像一道物理屏障,将许多消费级 AI 创业项目死死挡在门外。

昂贵的智能杀死了消费级产品

Segment 联合创始人 Calvin French-Owen 在最近的文章中指出了一个反常识现象:消费级 AI 公司其实非常稀少。在移动互联网时代,廉价网站带来病毒获客,再通过广告变现的经典打法,在 AI 时代失效了。每次请求背后真实存在的推理成本,打破了传统的规模经济模型。

很多没跑出来的 AI 产品,核心死因是商业模式在成本端算不过账。Sonnet 级别的前沿模型虽然能力强大,但在处理日常高频请求时,其昂贵的单价注定它只能停留在企业级的高净值场景。

大部分工作不需要 180 的智商

真实世界的大部分工作,绝大多数任务不需要 180 的智商。Calvin 引述了另一位创始人 Peter Reinhardt 的观察,他目前管理着 Charm Industrial 等多家公司,自估 95% 的工作都属于响应快、多线程推进的流水线作业。这种被他称为 “token spewer” 的工作负载,前沿模型的深度推理能力往往属于性能过剩。

企业里的绝大部分“人类 Token”,本身花在这些快速流转的任务上。这说明在解决前沿工程或模型训练等硬骨头之外,市场上存在着一个巨大的、对快、便宜、够用有着极致渴求的真空地带。

当十美分跨过够用门槛

变化正在发生。Calvin 实测发现,gpt-5.6-luna 能以约 100 tokens/秒的速度,流畅处理涵盖代码库、邮件和知识库的复杂检索线程。跨数千封邮件搜索的 API 费用只有几十美分,它将前述那个单次 1 美元的新闻站成本,直接压到了约 0.10 美元。

Artificial Analysis 模型价格对比 图:Artificial Analysis 模型价格对比。来源:calv.info 原文

GLM 5.3 也在 Pareto 前沿上新增了一个极具竞争力的坐标。当成本下降一个数量级,AI 应用的瓶颈正式从模型能力切换到了单次调用成本与用户价值的比值。 跨越这道阈值后,曾经被高昂算力锁死的消费级产品和高并发工作流,终于能在商业模式上实现收支平衡。

围绕土豆模型的工程繁荣

在 Hacker News 的讨论中,社区已经看到了下一步的演进路径。开发者 swatcoder 认为,现在用昂贵的全能模型去猜测用户懒散的意图只是婴儿期,未来的常态将是模型与各类 Harness(工具台)的深度结合。这种窄而高效的组合,将催生应用层大爆发般的繁荣。

另一种实用的工程范式是,先用大模型进行 Prompt 迭代和多变体验证,然后将固化下来的流程交给小模型执行。只要给轻量级模型配上足够好的环境防护机制和权限体系,即使在算力贫弱的设备上也能挖出可靠的工程结果。

小模型的意义要按成本结构来算,不能按跑分来算。当单次 0.10 美元的模型也能在终端长程任务中跑通复杂的业务逻辑时,AI 应用竞争的游戏规则已经变了。现在的问题是,谁能最快在这个新的成本结构里,造出下个时代的杀手级应用。

参考链接:

  • Calvin French-Owen:Small Models Have Arrived
  • Hacker News 讨论帖 (49466917)