ChatGPT Work 实测:装上浏览器,正式与聊天解绑

ChatGPT Work 实测:装上浏览器,正式与聊天解绑

ChatGPTAgentOpenAI

数据源:HN + web research

2026 年 8 月 30 日,Simon Willison 公布了对 ChatGPT Work 的长篇深度实测。测试结果表明,OpenAI 已经将原本依附在聊天界面里的代码沙箱,升级为一个拥有「联网代码环境 + 完整 headless Chrome + 持久文件系统」的完备系统。

这标志着 OpenAI 正式把「提供答案」和「完成任务」分流为两条独立的产品线。ChatGPT Work 验证了一个判断:给 LLM 配齐合适的工程环境,它就能作为独立的 agent 平台运转。

彻底解绑聊天与工作流

从 7 月 9 日发布至今,ChatGPT Work 呈现出两种截然不同的演化路径。网页端和移动端被称为 Work Cloud,为专业用户提供完整的工程环境;前身为 Codex 的桌面端则演化为面向非开发者的 Work Local。这两条产品线构成了当前 OpenAI 在任务自动化领域的基础盘。

这种产品形态的分化直接反映在商业模式和权限控制上。目前仅有每月 20 美元以上的订阅用户可以使用该功能,8 美元的 Go 档位和免费用户被排除在外。将资源密集型的 agent 操作隔离在高溢价梯队,是 OpenAI 控制算力成本的直接手段。

官方给出了非常明确的场景界限:Chat 模式用于寻求答案和灵感碰撞,Work 模式专用于完成具体任务。当你需要撰写产品 brief、生成数据报表或跑通一个长线的工作流时,Work 模式才是正确的入口。在这个模式下,大模型转型为接受指令后自主调动资源的自动化单元。

ChatGPT app 界面:Chat 与 Work 双 tab 切换 图:ChatGPT app 界面:Chat 与 Work 双 tab 切换。来源:Simon Willison

危险与强大并存的执行沙箱

Work Cloud 最核心的突破,在于彻底放开了网络执行环境的限制。它默认允许代码沙箱直接访问所有外部域名。开发者可以让大模型去 clone 任何开源项目,安装第三方依赖,或者直接抓取其他网站的公开数据。

作为对比,Claude 的沙箱容器依然严格执行白名单制度,仅对 PYPI、NPM 和 GitHub 等特定安全域名开放。OpenAI 放弃白名单策略,是用可控的沙箱逃逸风险换取真正无缝的外部系统集成能力。 这种产品策略的转换,意味着大模型的应用边界从「文本生成」正式跨越到了「系统交互」。

这套开放机制在关键节点依然保持了克制。在涉及用户登录、授权认证等高风险操作时,系统一旦侦测到密码或 2FA 验证环节,就会将控制权交还给用户接管。凭证数据不经过模型流转,提供了当前平衡自动化效率与账户安全的有效方式。

完整浏览器接入大模型底座

最让技术社区感到意外的特性,是 ChatGPT Work 直接内置了完整的 headless Chrome。大模型在运行 Python 脚本之外,可以直接在沙箱里加载网页、渲染 DOM 节点、填写表单,甚至运行 JavaScript 进行复杂的页面交互。

Simon 在实测中利用 playwright.evaluate 脚本,让 ChatGPT 直接提取了他个人博客的文章标题及元数据。过去需要开发者自己搭建爬虫架构、处理复杂的反爬机制,现在只需一句自然语言指令,大模型就能调动完整的浏览器内核来完成数据提取。

ChatGPT Work 用浏览器截图实时站点 图:ChatGPT Work 用浏览器截图实时站点。来源:Simon Willison

当大模型可以直接操纵浏览器对象模型时,所有未提供 API 的古老 IT 系统都被迫实现了可编程化。 对于那些重度依赖传统企业软件的公司来说,这极大降低了自动化改造的历史债务成本。企业彻底摆脱了等待软件供应商开放接口的被动局面。

持久化状态与任务分发网络

除了网络限制的解除和浏览器的接入,Work Cloud 还提供了一个名为 /workspace 的持久化共享文件系统。这个目录被统一挂载到用户所有的 Work session 中,支持跨会话读写和状态继承。Simon 发现他的文件系统里已经堆积了 171 个临时工作文件夹。

在这个文件系统的基础上,ChatGPT Sites 进一步将执行成果固化为可访问的服务。借助 Cloudflare Workers、D1 数据库和 R2 存储底座,用户可以直接让模型构建并部署完整的状态化 Web 应用。这些站点默认处于私有状态,同时也支持一键生成公开链接对外服务。

ChatGPT Sites 生成的「伦敦鹈鹕图鉴」网站截图 图:ChatGPT Sites 生成的「伦敦鹈鹕图鉴」网站截图。来源:Simon Willison

底层的模型调度系统也做了相应升级。在调用基于 GPT-5.6 架构的 Sol、Luna 或 Terra 等级模型时,主干模型可以将复杂任务拆解,并派发给多个子 agent 并行处理。结合新增的定时 prompt 触发机制,整个系统具备了常驻后台、周期性独立调度的工程能力。

工程师体验两极分化

在 Hacker News 社区,关于 ChatGPT Work 的讨论充满了两极分化的体验报告。「AI 会毁灭工作」和「AI 毫无用处即将崩盘」的极端论调,在这里被具体的工程实践还原为具体的技术探讨。

有用户分享了极其科幻的使用场景:在下班路上用手机远程唤醒 Work 会话,通过简单的语音指令,让大模型在后台翻阅附加的长文档并自动起草邮件回复,甚至协助填完了一份冗长的多步骤移民签证表格。这种体验被形容为「钢铁侠电影里的贾维斯真正走进了现实生活」。

部分硬核开发者给出了另一种判断。如果每天的繁杂邮件可以在 20 分钟内被自动化脚本搞定,说明这部分工作本身属于低价值的重复劳动。 把糟糕的流程通过 AI 工具变高效,容易掩盖流程本身缺乏业务价值的事实。技术升级并不能替代流程再造,这是企业在引入自动化工具时必须直面的问题。

ChatGPT Work 的核心价值在于它证明了通过「浏览器+沙箱+文件系统」的工程组合,LLM 可以从头到尾独立完成真实世界的基础任务。当大模型能够常驻后台、自主调度资源并与外部网络自由交互时,agent 已经全面演变为下一代操作系统的雏形。

参考链接:

  • Simon Willison 实测报告
  • Hacker News 讨论帖