思考强度滑块:把推理预算变成显式旋钮
2026年8月6日,OpenAI 官方发布了 29 页系统卡与 GPT-5.6 八月更新,在 ChatGPT 周活跃用户突破 10 亿的节点上推出两款核心模型:面向付费用户的升级版 GPT-5.6 Sol,以及面向免费用户的 GPT-5.6 Luna。界面中最显著的变化在于 Plus 与 Pro 账户引入的「思考强度滑块」(thinking slider)。用户现在可以手动调节模型在给出最终回答前投入的算力深度。
过去,推理模型的思考时间依赖系统后台根据提示词复杂度自动分配,算力预算被包裹在黑盒机制中。随着滑块的加入,用户在快速问答与长程代码重构等不同场景下有了直接分配 effort 的权限。把隐藏参数转变为显式旋钮,反映出 OpenAI 对模型推理效率控制力的提升,算力分配的粒度开始由前端交互直接接管。
免费无限聊天背后的推理成本曲线
在免费与 Go 订阅层级,GPT-5.6 Luna 正式替代 GPT-5.5 Instant 成为默认模型,并全面放开无限制的文本聊天体验。系统同时预告将在下周上线「Think」按钮,专门用于处理跨领域的复杂推理任务。对于文件解析、语音交互与图像生成等多模态功能,平台仍保留原有的独立额度限制。
图:ChatGPT Free 用户新的 Think 按钮。来源:OpenAI via TechCrunch
向 10 亿周活规模的庞大受众开放无限制文本生成,直接印证了单 token 推理成本的高速衰减。如果边际计算成本没有下降到微小的数量级,厂商很难在免费层级承受无界流量冲击。这一定价结构的演进表明,基础模型架构的工程优化已经转化为前端商业策略的下沉动力。
垂直领域准确率演进与安全评估
OpenAI 系统卡公布的评估数据显示,在金融、医疗与法律等高难度提示词测试集上,Luna 的事实错误率相比 GPT-5.5 Instant 降低了 62%,Sol 的错误率降低了 68%。在特定高风险测试集中,Luna 的错误率降低超过 60%,其余测试集中平均下降约 30%;Sol 则在全部三个测试集上展现出约 60% 的统一降幅。评测过程结合了基于大语言模型的自动打分与实时网页检索校验。
在 Preparedness Framework(准备度框架)安全评估中,Sol 与 Luna 在网络安全(Cybersecurity)和生物化学(Biological/Chemical)领域均被评定为 High 级能力,而在 AI 自我改进(AI Self-Improvement)维度未达到 High 阈值。本次评估还首次加入了专门针对未成年人(U18)的安全影响专项测试。准确率在专业领域的提升证明了推理过程干预在抑制作幻觉方面的成效,但高能力级别的评定也意味着模型上线后的合规审查门槛全面抬升。
区分粒度部署与边界争议
图:ChatGPT Plus/Pro 思考强度滑块。来源:OpenAI via TechCrunch
本次八月版本的部署范围存在清晰的业务边界:Codex 和 ChatGPT Work 内部集成的模型依旧维持在 7 月份的版本状态,更新仅覆盖 ChatGPT 主产品界面。在性能表现上,Sol 减少了冗余的格式化表述,并在简单顺从无助于解决问题时主动提供更正。
社区对于手动滑块的设计形成了两种截然不同的技术视角。赞成者认为显式调节赋予了开发者和高级用户精准控制延迟与精度的能力,避免简单查询浪费算力;质疑者则指出把算力权衡交还给用户增加了交互决策负担,全自动调度才是更优解。这种部署时间差与设计争论,折射出生产力工具对确定性架构的硬性要求,以及消费级 UI 在探索算力把控时的妥协。
算力分发逻辑的范式转变
从 GPT-5.5 时代的固定配额到 GPT-5.6 Sol/Luna 的可调体验,OpenAI 的更新展现了 AI 产品核心动力的迁移。算力上限不再是划分付费阶梯的唯一壁垒,调控粒度与响应策略上升为产品差异化的中心。
思考强度滑块与免费无限文本聊天的并行,本质上是推理成本快速下降在产品形态上的映射。当各家前沿模型的基础能力差距逐渐缩小,如何在前端提供精准的算力调配接口并保持服务经济性,将成为下一阶段 AI 基础设施竞争的关键场域。
参考链接:
- OpenAI 官方公告与系统卡 PDF
- TechCrunch 报道:ChatGPT 周活破 10 亿与 GPT-5.6 更新
- 9to5Mac 报道:Sol 思考强度滑块全端支持
- MacRumors 报道:Sol 紧凑回答与智能纠错机制