ChatGPT为什么把Chat和Work分开?AI产品正在从对话框变成工作系统
OpenAI推出ChatGPT Work,将Chat与Work明确分离,标志着AI产品的基本单位正从“一条消息”转向“一项工作”。本文深入剖析这一变化背后的产品逻辑,探讨长任务场景下界面设计、上下文管理、交付物定义等核心问题,为产品经理提供全新思考框架。

想象一下,你把这样一项任务交给AI:读取过去3个月的客户访谈和销售记录,分析流失原因,和5家竞品做对比,最后输出一份下季度产品策略,以及一套能拿去汇报的演示稿。
如果这件事放在聊天框里,最开始的体验可能很好。输入需求,看到“正在思考”,几分钟后出现一长段结果。
但任务一旦持续半小时、两小时甚至更久,问题马上变了:它现在读到哪一份资料?用了哪些数据?是还在运行,还是已经卡住?中途有一个假设不对,能不能只改方向,不推倒重来?它准备调用CRM时,是否应该先问我?最后交付的是一段文字,还是一份能继续编辑、分享和更新的材料?
这些都不是“回答得够不够聪明”的问题,而是聊天框本身装不下一项完整工作。
2026年7月9日,OpenAI推出ChatGPT Work,并在产品里把Chat和Work明确分开。官方给出的区分很直接:Chat用于快速问题和对话式帮助,Work用于更长、多步骤的工作和完整交付物,Codex则继续面向软件开发和技术任务。

图1:ChatGPT Work生成并编辑演示稿的界面,图片来源:OpenAI官方ChatGPT Learn
看起来只是顶部多了一个切换项,背后却是一个重要信号:AI产品的基本单位,正在从“一条消息”变成“一项工作”。
一、一个看似多余的开关,暴露了聊天框的边界
过去几年,AI产品的能力不断增加,但大多数能力仍被塞进同一个对话框。搜索、画图、数据分析、写代码、操作网页,入口都是一句“你想做什么”。
这种统一很迷人。用户不必学习复杂菜单,只要会说话就能使用所有工具。但它也悄悄掩盖了一件事:不同任务对产品的要求完全不同。
问“深圳明天会不会下雨”,用户期待十几秒内得到答案。让AI完成一份季度经营分析,等待本身并不奇怪,用户更在意数据是否齐全、计算有没有口径问题、过程中做过哪些判断,以及产物能不能拿去开会。
前者的产品契约是“我问,你答”;后者的产品契约是“我给目标,你负责推进,并让我随时知道发生了什么”。
所以,Chat和Work分开并非简单的模型档位。它是在界面上承认两类用户意图:有些时候,人需要一个谈话对象;另一些时候,人是在委派一项工作。
这两个场景共用输入框没有问题,共用同一套过程和完成标准,问题就大了。
二、消息不是工作,任务才是
聊天产品最熟悉的数据结构,是一组按时间排列的消息。用户发一句,AI回一句,下一轮继续引用前文。只要对话不太长,这种结构足够自然。
一项工作却不是几百条消息的总和。它至少包含5样东西:目标、约束、计划、当前状态和交付物。
还是那份产品策略。目标是找出流失原因并提出下季度动作;约束可能包括只使用今年数据、隐藏客户隐私、结论必须有来源;计划要说明先整理材料还是先做竞品研究;当前状态要告诉用户哪些步骤已经完成;交付物则是可审阅的数据集、策略文档和演示稿。
如果这些信息只散落在聊天记录里,用户每次回来都要重新阅读上下文,Agent也容易把早期讨论、临时想法和最终决定混在一起。对话越长,真正有效的任务状态反而越难看见。
工作系统需要把“任务”做成一个独立对象。它有名称、有负责人、有资料范围、有运行记录,也有明确的完成条件。聊天仍然存在,但它变成了操作任务的一种方式,不再承担全部产品结构。
这个变化听起来像后台架构,实际会直接改写前台体验。用户关闭窗口再回来,看到的应该是“竞品资料已整理,正在核对客户流失数据,还有1个口径等待确认”,而不是从第87条消息继续往下翻。
三、任务持续几小时后,界面必须说清楚正在发生什么
短对话里,“正在思考”是一个勉强够用的状态。长任务里,它几乎等于什么都没说。
一项持续数小时的工作,至少会经历规划、执行、等待输入、等待审批、失败、恢复和完成。有些步骤可以并行,有些步骤必须等人确认,有些错误可以自动重试,还有些异常必须立即停下。
如果产品仍然只显示一个旋转图标,用户会陷入两种选择:不断追问“好了吗”,或者干脆离开,把任务遗忘在后台。
真正有用的进度也不是随手给一个“已完成67%”。知识工作很难像文件下载一样精确计算百分比。比起虚假的精度,用户更需要三个答案:已经完成什么、现在正在做什么、下一步准备做什么。
ChatGPT Work允许用户查看进度、回答问题、改变方向并批准重要操作,这些能力共同指向同一件事:长任务界面的核心不再是输出速度,而是状态可见性。

图2:长任务需要暴露计划、执行、等待与恢复状态,制图:知序
这里还有一个容易被忽略的设计细节。Agent提出的问题不能只是插在文本流里。如果它在第43分钟询问“是否允许访问销售系统”,而用户没有看到,整项工作可能安静地停几个小时。真正阻塞任务的问题,应该进入待办、通知或审批中心,并明确说明不回答会影响什么。
状态一旦变长,提醒、超时、重试和恢复就不再是边角功能,它们会成为主流程。
四、上下文不再是聊天记录,而是临时工作环境
长任务的第二个变化,是上下文从“我们刚才聊过什么”扩展为“完成这项工作需要进入哪些地方”。
截至2026年7月30日,OpenAI官方产品页显示ChatGPT Work可以连接团队工具、文件和桌面应用,并提供1400多个Plugins。官方列出的场景包括Slack、Microsoft Teams、Google Drive、SharePoint、邮件、日历、CRM和项目管理工具。桌面端在获得许可后,还可以使用本地文件、桌面应用、内置浏览器和Computer Use。
连接得越多,产品经理越不能把“上下文”理解成一个越大越好的资料包。
同一家公司里,市场策略任务可能需要客户访谈、竞品网站和广告数据,却不应该默认看到薪酬文件;销售复盘需要CRM和邮件,但未必需要修改客户信息。上下文的价值取决于相关性,风险则来自访问范围和停留时间。
因此,工作系统需要回答4个问题:这项任务能看什么,为什么要看,看到的信息来自哪里,任务结束后权限和临时资料如何处理。
传统聊天产品常把引用来源放在答案末尾。Agent开始跨系统行动后,来源还要前移到过程里。用户应该知道某个结论用了哪份文件,某个动作调用了哪个系统,某项数据是不是已经过期。否则,任务越自动,出错后越难追溯。

图3:ChatGPT Work的Plugins界面,图片来源:OpenAI官方ChatGPT Learn
五、答案退出中心,交付物成为完成标准
聊天产品天然偏爱文本答案,因为答案出现就意味着这一轮结束。工作却往往要落在某个可以继续使用的东西上。
ChatGPT Work把文档、表格、演示稿、报告和Sites列为核心产物。Sites还可以把计划、数据和想法变成可分享、可更新的轻量网站,例如仪表盘、项目追踪器、发布日历和内部入口。
这个变化的产品意义,比“多支持几种文件格式”更大。
一段回答通常属于当前会话,交付物则要进入后续协作。它需要可编辑、可分享、可追踪版本,也要能说明用了哪些来源、何时更新、谁批准了最终版本。用户判断任务是否完成,也会从“AI有没有回复”变成“这份东西能不能直接进入下一步”。
产品经理在设计Agent需求时,可以少问一句“它要回答什么”,多问一句“用户拿什么离开”。
如果目标是市场研究,完成标准可能是一份带来源的数据集和一页结论;如果目标是筹备发布会,完成标准可能是日历、任务清单和风险面板;如果目标是经营分析,完成标准则可能包括可复算的表格和管理层演示稿。
交付物一旦清楚,Agent该读取什么、何时停下、如何验收,也会跟着清楚很多。

图4:ChatGPT Work生成可继续编辑的电子表格,图片来源:OpenAI官方ChatGPT Learn
六、Scheduled Tasks把一次会话变成持续服务
ChatGPT Work还把Scheduled Tasks放进了工作场景。任务可以只运行一次,也可以按时间重复、由事件触发,或者持续监控变化。
这意味着AI产品不再只在用户打开页面时工作。它可以每周读取新的客户反馈,更新问题分类;每天检查项目进展,刷新管理层摘要;当竞品页面发生变化时,重新整理差异并通知负责人。
听起来像传统自动化,但Agent让输入和过程更开放。用户给的是目标和资料范围,具体步骤可以根据新情况调整。它带来的灵活性更高,也让运行过程更难预测。
一旦任务跨越多天,产品就必须补上另一组信息:上次什么时候运行,处理了哪些新增内容,下次什么时候开始,本轮花了多少资源,权限失效后怎么办,连续失败几次后暂停,用户如何一键关闭。
一个没有清晰暂停入口的长期Agent,就像一个找不到取消订阅按钮的服务。它也许一直在工作,却很难让人真正放心。

图5:ChatGPT Work的Scheduled Tasks界面,图片来源:OpenAI官方ChatGPT Learn
七、用户从操作者变成监督者
在Chat里,用户通过一轮轮提示推动过程。每一步几乎都由人发起,控制感来自频繁操作。
进入Work后,用户把目标交出去,Agent自行拆解并连续执行。人的角色随之变成监督者:看计划是否合理,回答关键问题,在高风险动作前审批,发现方向不对时及时纠偏,必要时接管。
这不是简单地把按钮从“执行”换成“批准”。产品需要按风险安排不同控制点。
低风险、可逆的动作,例如整理公开资料,可以默认执行并留下记录。会影响外部对象的动作,例如发送邮件、修改CRM或发布网站,可以在执行前确认。涉及资金、权限、隐私和不可逆变更时,则需要更严格的授权、二次核对和回滚方案。
好的监督体验还有一个标准:用户介入之后,不必把整项任务推倒重来。改一条假设,只重跑受影响的步骤;拒绝一个动作,Agent能够换方案继续;人接管完成一部分后,任务还知道从哪里恢复。
Agent越能自主行动,产品越要认真设计“怎么打断它”。
八、做成工作系统后,旧指标会开始骗人
聊天产品常看日活、对话数、消息数、首字出现时间和用户满意度。这些指标仍有价值,但它们很难回答一项工作到底有没有完成。
一个用户每天只发1条指令,Agent却替他完成一份过去需要3天的分析。从消息数看,这是低活跃;从业务结果看,它可能是高价值用户。反过来,一个任务产生200轮追问,也可能说明Agent不断跑偏。
工作系统至少要补4组指标。
第一组看结果:任务完成率、从委派到可接受结果的时间、交付物采用率,以及产物是否真的进入下一环节。
第二组看控制:人工干预率、等待审批时长、失败恢复率和被用户主动终止的任务比例。
第三组看质量:返工次数、关键来源覆盖、规则遵循情况,以及同类任务结果是否稳定。
第四组看经济性:单次任务成本、成功任务成本、节省的人时,以及后台任务长期运行产生的资源消耗。
这些数字不能孤立判断。干预率高,可能是Agent能力不足,也可能是产品把审批点设计得更谨慎;任务时间短,可能是效率提升,也可能是少做了必要步骤。指标最终要回到任务类型、风险和交付物质量上解释。
九、工作越长,三类风险越容易被忽略
第一类是安静跑偏。短对话答错一句,很快就会被发现。长任务如果在最初阶段理解错目标,后面每一步都可能做得很完整,直到交付时才暴露方向问题。计划确认、阶段性结果和关键假设可见,都是为了尽早截住这类偏差。
第二类是上下文和权限膨胀。为了少让用户配置,产品很容易默认连接更多应用、保留更多历史。久而久之,一个任务拥有的资料和权限超过实际需要。任务级授权、来源标记、到期回收和敏感动作审批,应该和连接能力同时设计。
第三类是成本与责任模糊。OpenAI说明Work采用与Codex类似的用量结构,复杂任务会消耗更多额度。对企业来说,更难算的还不只是Token:谁批准了昂贵任务,后台任务连续失败是否继续扣费,Agent产物导致错误决策时由谁复核,这些都需要进入产品规则。
长任务最大的风险,往往不是突然报错,而是在没人注意时持续消耗资源,并把一个早期误解加工成越来越像真的结果。
十、产品经理可以先回答这5个问题
1.用户交给AI的是一个问题,还是一项工作?如果需要多个步骤、跨越较长时间、调用外部系统并形成正式产物,就不该只用普通聊天状态承载。
2.任务的完成标准是什么?不要用“生成结果”收尾,要说清交付物、必要来源、质量门槛和进入下一流程的条件。
3.用户离开页面后,靠什么重新理解进度?计划、已完成步骤、当前阻塞、待审批事项和下一步,都应该脱离聊天记录独立存在。
4.哪些动作可以自动做,哪些必须等人?按照风险、可逆性和外部影响划分控制点,并为拒绝、超时和接管设计后续路径。
5.产品证明的是活跃,还是工作结果?把任务完成、交付物采用、返工、干预和单位成功成本放进同一套指标里,避免用消息数制造繁荣。
这5个问题回答清楚,产品才算真正从“给聊天框加工具”,走向“设计一套工作系统”。
十一、写在最后
ChatGPT把Chat和Work分开,是一个看起来很小、实际很诚实的产品动作。
它承认聊天框并非所有AI能力的最终容器。快速问题需要的是低门槛和即时反馈,复杂工作需要的则是目标、状态、上下文、权限、交付物与持续运行。两者都可以从一句自然语言开始,后面的产品结构却完全不同。
模型继续变强以后,会有越来越多任务从几分钟延长到几小时、几天,并跨过更多应用。到那时,真正拉开AI产品差距的,未必只是模型能做多少事,而是用户能否看懂它、管住它,并放心接过它完成的工作。
对话是一种交互,工作是一种状态机。
当AI开始交付工作,产品经理设计的就不该只剩一个对话框。
参考资料
OpenAI:ChatGPT Work发布说明
OpenAI:ChatGPT Work产品页
OpenAI Help Center:ChatGPT Work与Codex
OpenAI:ChatGPT Release Notes
OpenAI:企业数据隐私、安全与合规
OpenAI Help Center:企业用量与支出控制
本文由 @知序 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




