变化不只是模型更强
OpenAI 这次发布 GPT-5.6,最容易被拿来讨论的是模型分数、成本和推理能力。但对普通团队来说,更大的变化是:OpenAI 同时把 ChatGPT Work 推到台前,让聊天、Codex、连接器、浏览器、桌面应用和定时任务开始进入同一个工作代理界面。
换句话说,问题不再只是“这个模型会不会回答得更好”。更实际的问题是:你能不能把一段真实工作交给它,让它读材料、查网页、改文件、产出表格或幻灯片,然后用可审计的方式交回结果。
这也是为什么现在不该只看 benchmark。更该看的是工作流能否被验证、权限能否被控制、成本能否被计量、错误能否被回滚。
三个信号要一起看
第一个信号是模型层。OpenAI 说 GPT-5.6 系列包含 Sol、Terra 和 Luna:Sol 是旗舰模型,Terra 面向日常工作平衡能力和成本,Luna 则是更快、更低成本的选择。OpenAI 还强调 GPT-5.6 在 coding、知识工作、computer use、设计、网络安全和科学任务上更强,并引入 ultra 这种多代理并行工作方式。
第二个信号是产品层。ChatGPT Work 被描述为能跨应用和工作流收集信息,创建 sheets、slides、docs、web apps 等成品,并能把复杂项目拆成小步骤持续执行。它还和连接器、桌面应用、浏览器、本地文件、Scheduled Tasks 放在同一个故事里。
第三个信号是办公套件层。OpenAI 同步宣布 GPT-5.6 会成为 Microsoft 365 Copilot 在 Word、Excel、PowerPoint、Chat 和 Cowork 里的 preferred model。这意味着这不是只影响 ChatGPT 用户的更新,很多企业工作流会通过办公软件间接碰到它。
这三个信号合在一起,才是重点:模型能力、工作入口和企业分发渠道开始同时升级。
旧聊天助手 vs 新工作代理
可以用这张表理解变化。
| 维度 | 旧聊天助手 | 新工作代理 |
|---|---|---|
| 输入 | 你复制粘贴问题和材料 | 代理读取连接器、文件、网页和上下文 |
| 输出 | 一段答案、草稿或代码片段 | 文档、表格、幻灯片、网页应用、报告或任务更新 |
| 时间 | 一轮或几轮对话 | 可以持续数小时,甚至按计划重复执行 |
| 风险 | 回答错、遗漏上下文 | 还可能误用数据、误触动作、产生成本或改变文件 |
| 验收 | 人读答案 | 人要检查来源、差异、动作记录和最终产物 |
| 管理 | 个人提示词习惯 | 组织级连接器、权限、日志、额度和审批 |
所以,团队采用 ChatGPT Work 或类似代理时,不能把它当成“更聪明的聊天框”。更准确的角色是一个能接触工具和资料的初级执行者。它可以更有用,也更需要边界。
谁会先受影响
开发者会先感到工作界面变化。OpenAI 说 Codex app 会并入新的 ChatGPT desktop app,Codex 仍保留面向开发者和技术专业人员的能力,并加入 diff 内联编辑、侧边栏 PR review、更快的 computer use、单项目多仓库等能力。对开发者来说,coding agent 不再只是 IDE 或终端里的工具,而会和浏览器、桌面和移动端工作流更紧地接在一起。
产品经理、运营、市场和销售会被 ChatGPT Work 的跨工具能力吸引。官方例子包括从 CRM、邮件、Slack、Jira、会议资料和客户研究中生成 dashboard、launch check、campaign brief 和 account plan。这里的价值不是“帮我写一段文案”,而是把分散资料整理成可推进的工作物。
企业管理员和安全负责人会更早遇到治理问题。ChatGPT Work 的价值来自连接器、浏览器、桌面文件和自动化任务;风险也来自这些地方。谁能连 Slack?谁能读 Google Drive 或 SharePoint?哪些动作必须审批?日志怎么留?用户组额度怎么控?这些问题比模型名字更重要。
采用前先做六个检查
第一,选一个具体工作流,不要泛泛地说“让 AI 提高效率”。好的测试对象是你已经懂流程、能判断好坏、经常重复、资料来源明确的任务。例如月度预算差异分析、发布清单检查、销售会议准备、PR review 摘要、客户反馈归类。
第二,列清楚上下文来源。代理可以连接很多工具,但不等于应该默认读取所有工具。先把输入分成公开资料、团队共享资料、客户资料、财务/法务资料、个人文件和机密资料。越敏感,越需要更小范围、更强审批和更清晰日志。
第三,定义允许动作。读取、总结、生成草稿、创建文件、修改文件、发送消息、提交 PR、更新 CRM、改日程,这些不是同一个风险等级。初期可以允许读和写草稿,谨慎开放会影响外部对象或生产环境的动作。
第四,设计验收方式。工作代理最危险的不是“完全不会做”,而是做出一个看起来完整但来源、数字或逻辑有误的结果。每个试点工作流都应该有验收清单:引用了哪些来源,改了哪些文件,哪些数字需要人工复核,哪些结论只是推断。
第五,盯住用量和成本。OpenAI 官方说明里强调 GPT-5.6 的效率,也说明 ChatGPT Work 的用量会随工作量变化,复杂任务可能消耗更多计划用量。多代理、浏览器、连接器和长任务都可能改变成本结构。不要用单轮聊天的成本感觉评估工作代理。
如果你在比较托管模型在不同 agent 工作负载中的效率与路由方式,可以继续看Gemini 3.6 Flash 与 3.5 Flash-Lite 的模型选择指南。
第六,保留退出路线。所有代理生成的文档、表格、代码和任务记录都应该能回滚、对比和复查。尤其是桌面文件、本地应用、业务系统和生产代码,必须先想好出错时怎么恢复。
不要把安全系统卡当成营销页
GPT-5.6 的系统卡值得认真看。OpenAI 说 GPT-5.6 在网络安全和生物领域比早期模型更强,但没有跨过其 Critical threshold。它还区分了合法防御、代码审查、漏洞修复、教育和高风险滥用。
这对读者的意义不是“这个模型绝对安全”,而是更现实的两点。
第一,能力越强,越需要区分用户、任务和环境。一个模型能帮你做安全审计,不代表所有人、所有场景都应该拿到同样权限。第二,系统卡给的是测试边界,不是你组织自己的风险评估。你的数据、插件、浏览器权限、审批流程和日志质量,才决定实际风险。
如果团队要在安全、代码、财务、法律或客户数据场景里用 ChatGPT Work,应该把系统卡当作起点,而不是最终答案。
哪些仍不确定
第一,benchmark 不等于你的工作流。OpenAI 给了大量评测、客户引用和性能数据,但你的真实收益取决于资料质量、连接器、团队流程和验收方法。
第二,效率不等于总成本一定下降。更强模型可能少走弯路,但如果你开始把更长、更复杂的任务交给代理,总用量仍可能上升。
第三,连接器越多,治理越重要。AI 能跨 Slack、邮件、云盘、CRM、浏览器和桌面工作,是价值来源,也是风险来源。
第四,个人用户和企业用户看到的体验可能不同。OpenAI Help 写明 GPT-5.6 Sol in ChatGPT 正在向符合条件的付费计划推出,Free、Go 和未登录用户不包含在内;组织管理员设置也会影响可用性。
一个保守的试点路线
如果你现在想试 GPT-5.6 或 ChatGPT Work,不要从最敏感、最不可逆的任务开始。
更好的顺序是:
| 阶段 | 适合任务 | 验收重点 |
|---|---|---|
| 只读总结 | 会议纪要、竞品资料、公开网页研究 | 来源是否完整,是否遗漏关键反例 |
| 草稿生成 | brief、报告、发布清单、PR 摘要 | 结构是否可用,事实是否可核 |
| 文件产物 | 表格、幻灯片、内部页面、dashboard | 格式、公式、引用、版本差异 |
| 半自动执行 | 定时更新、监控变化、准备材料 | 审批点、日志、通知和回滚 |
| 高权限动作 | 提交代码、更新客户系统、发送外部消息 | 最小权限、人工批准、审计记录 |
这个路线不激进,但足够实用。工作代理最适合先替你整理、准备、对比和生成可检查产物,再逐步进入动作层。
FAQ
GPT-5.6 已经正式发布了吗?
OpenAI 在 2026 年 7 月 9 日发布 GPT-5.6 系列,包含 Sol、Terra 和 Luna,并称其已从 limited preview 进入 general availability。
ChatGPT Work 和普通聊天有什么不同?
普通聊天主要回答问题或生成内容;ChatGPT Work 被设计为跨连接应用、文件、浏览器和桌面执行更长的工作流,并能产出表格、文档、幻灯片、网页应用等材料。
免费用户能用 GPT-5.6 Sol 吗?
OpenAI Help 的 release notes 写明,GPT-5.6 Sol in ChatGPT 正在向符合条件的付费计划推出,Free、Go 和未登录用户不包含在内;不同产品和计划可用性要看模型选择器或当前 rate card。
企业最该先检查什么?
先检查连接器范围、浏览器/网络访问、本地文件权限、敏感动作审批、日志合规、用户组额度和成本上限。
这会让所有工作都自动降本吗?
不能这样承诺。模型可能更高效,但长任务、连接器、浏览器和多代理模式可能消耗更多计划用量。真正成本要用自己的重复工作流测试。
图片和信源说明
封面图为 Wesbase 原创采用清单图,没有使用 OpenAI、ChatGPT、Microsoft、Copilot、合作伙伴或媒体 logo。本文依据 OpenAI GPT-5.6 发布页、ChatGPT Work 发布页、GPT-5.6 system card、OpenAI Help model release notes,以及 OpenAI 关于 Microsoft 365 Copilot 采用 GPT-5.6 的说明。文中把官方事实、本文推断和仍不确定的采用风险分开表述。