8 月 5 日,数据库公司 Neon 公布了一份成绩单:一个 40 亿参数的开源小模型(底座是阿里开源的 Qwen3.5),在一项叫「检索」的任务上得分 1.447;OpenAI 目前最贵的前沿模型 GPT-5.6 Sol,得分 1.369。小模型赢了,而它每处理一次请求的成本,只有对手的约 1/100。
这份成绩单发布后在技术社区拿到近 200 个赞、几十条讨论,争议和惊叹一样多。笔者先把这件事拆开讲清楚:检索是什么、100 倍是怎么算出来的、以及这份成绩单到底可不可信。
检索:AI 回答问题的第一步
先解释「检索」。你问 AI 助手「公司报销火车票要提前几天订」,它不会把整座图书馆背下来再回答——它会先找到正确的那排书架、抽出对的那本书、翻到那一页,然后把答案念给你听。这个「找书」的动作,就是检索。
ChatGPT 这类助手答得准不准,一半看检索。资料找对了,后面组织语言再差也差不到哪去;资料找漏了,生成得再流畅也是编的。企业场景更明显:客服机器人、内部知识库问答,背后都是一大堆文档、工单、产品手册,AI 得先从这里面把相关内容捞出来。
图:传统检索(一次搜完)与智能体式检索(多轮搜索、逐步逼近)的流程对比。来源:neon.com
以前「找书」只找一次就完事。现在的 AI 会像人查资料一样:搜一次、看看结果、不满意再搜一次,多轮逼近答案。Neon 在博客里算了笔账:用 GPT-5.6 Sol 跑一次这样的多轮检索,要 10 秒以上、大约 3 美分。每多搜一轮,就多付一次顶级模型的钱——检索成了最烧钱的环节之一。
为什么偏偏是「检索」先翻盘
开源小模型反超闭源巨头,为什么先发生在这种任务上?三个原因。
第一,任务足够聚焦。检索的目标很单一:找到正确的那份材料。练好这一个动作,比当一个样样通的全能选手容易得多。HN 讨论里有个比喻很到位:「你不会让博士去车间流水线」——重复性的检索工作,用便宜的小模型就够了。
第二,评估足够客观。找对了就是找对了,机器能自动判卷。这一点决定了训练方法:让模型拿着搜索工具反复试错,找对了加分、找错了扣分,成千上万轮练下来,模型就学会了「什么时候该搜、该搜什么」。训练前这个模型得分 0.382,训练后 1.447——能力是实打实刷题刷出来的,顺便也说明开源社区迭代快、微调技术成熟,不需要从零训练大模型。
图:训练过程中模型平均得分(reward)随训练步数一路爬升。来源:neon.com
第三,数据就在企业自己手里。把公司自己的文档自动改写成「问题—答案」练习题,微调管线一跑,文档库就变成了专属模型。数据不出门,还顺带解决了隐私顾虑。
100 倍怎么算的:把账摆给你看
「便宜 100 倍」听起来像广告词,其实是一笔可以查的账。
先看单价。GPT-5.6 Sol 的 API 价格是输入每百万 token 5 美元、输出每百万 30 美元——闭源顶级模型贵在「每问一次都要付钱」。开源小模型的托管价格是输入 0.03 美元、输出 0.15 美元,价差大约 160 到 200 倍。
再看实测。Neon 给出的单次检索请求成本:GPT-5.6 Sol 约 0.0873 美元,小模型约 0.00092 美元,相差 94.9 倍,对外宣传时四舍五入成 100 倍。
图:横轴是单次请求成本,纵轴是评估得分,越靠左上越好。来源:neon.com
换算成日常规模:一家公司每天跑 10 万次检索,用 Sol 一天约 8700 美元、一个月超过 26 万美元;用这个小模型,一天 92 美元。当用量放大到百万级,「贵 100 倍」直接决定一项业务做不做得起。 AI 价格战打到现在,降价的主角已经从「大模型打折」变成了「小模型替代」。
争议:这份成绩单,两边都有话说
最关键的质疑来自测试本身。这份对比是厂商自己测的:测试集是自己生成的、完整题目没有公开、也没有跑行业公认的通用检索基准。有 HN 用户直言对这类厂商成绩单零信任——「一切 benchmark 都在被往有利的方向调」。AI Pricing Guru 的独立分析也指出,成绩单缺少数值细节,外人无法复现。
支持的一方也有论据。检索的判分标准相对客观,训练曲线(0.382→1.447)是实打实的进步;社区里也有人分享过自己的测试——小模型在「从文档里找事实」这件事上确实能赢过更大的模型,大模型反而容易想太多、绕远路。而且成本差本身没有争议:公开价格表摆在那里,token 单价差 200 倍是事实。
笔者的判断是:「成本差 100 倍」大概率是真的,「打平甚至击败」目前只在厂商定义的测试场景里成立。 连 Neon 自己文里说的单次成本(约 3 美分)都和对比图里的数字(8.7 美分)对不上,说明成本怎么算、算多少,本身就很难统一。真实世界的检索比测试集脏得多——文档过时、表述模糊、答案被埋得很深,小模型在这些地方会不会翻车,只有大规模实际使用才能回答。至于写代码、长文推理这些别的任务,专才小模型目前还远不是全能巨头的对手。
这场价格战,接下来会打到哪
回看这份成绩单:100 倍的成本差是真实的,性能优势需要复现,但它标志着一个方向——AI 正在从「一个什么都干的全能巨无霸」,走向「一堆各管一摊的便宜专才」。 对普通人来说,这意味着 AI 服务会越来越便宜:企业用得起内部知识库问答了,客服机器人的账单撑得住了,这些省下来的成本,最终会体现在你用的产品价格里。
对行业来说,价格战的战线已经从「模型卖多少钱」延伸到「同样的任务用谁来做」。开源小模型每在一个任务上追上闭源巨头,那个任务的定价权就松动一分。检索是第一个被攻破的阵地,它多半不会是最后一个。
参考链接:
- Neon 博客:How Castform + Neon Beats Frontier Models on Price and Efficiency
- HN 讨论 (item?id=49186762)
- AI Pricing Guru:Castform Beats GPT-5.6 Sol: Cost Impact (August 2026)