Codex 160天涨到800万:真正变强的不是模型
写在前面
Codex这条增长线很容易被看成一句热闹的口号:160天,从100万活跃用户涨到800万。但如果只盯着“模型更强了”,反而会错过真正值得开发者学习的部分。
更关键的变化是产品形态。Codex先从命令行长到桌面App,再把Plan Mode、审批、任务分叉、自动化、浏览器、手机远程、Record & Replay串起来,最后和ChatGPT Work一起变成双产品入口。增长不是单点爆炸,而是工作入口一层层打开。
这件事对所有做AI Agent、AI编程工具、企业内助手的人都有参考价值:模型负责把上限抬高,产品负责把更多人带进来,额度和反馈机制负责让用户反复把真实任务交出去。
第一刀:先把终端工具变成任务指挥台
Codex最早不是今天意义上的产品。2021年7月,它更像GPT-3面向代码能力的微调版本,用大量GitHub开源代码训练,可以把自然语言翻译成代码。后来GPT-3.5、GPT-4本身具备了足够强的代码能力,2023年Codex API被关闭。
直到2025年,Codex重新被拿出来,定位已经变了:它不再只是代码模型,而是云端软件工程Agent。Codex CLI让它重新贴近开发者,因为终端是很多工程师最自然的工作区。
但CLI也有天然天花板。顶尖工程师可以在tmux里并行跑十几个会话,把多个终端窗口当成Agent集群;普通用户看到黑底命令行,只会觉得门槛太高。
真正的第一次换挡,是Codex App。它把多Agent、后台长任务、worktree、自动化和技能放进可视化界面,把“会用终端的人才能并行调度Agent”改成了“任何人都能看见任务、分叉任务、验收任务”。

这一步的本质,不是给CLI套一层皮,而是把用户能力问题变成产品设计问题。三天后,Codex超过100万活跃用户;App首周下载超过100万,整体用户单周增长超过60%。这个阶段的增长逻辑非常清楚:先把入口做大。
第二刀:让Agent过程可控,用户才敢深用
从2M到4M阶段,Codex的重点不再只是“能不能把答案做出来”,而是“用户能不能看懂过程、打断过程、复用过程”。
3月到4月,终端上下文、自动化重构、插件、计划与审批、任务分叉陆续补齐。到4月3日,App已经超过CLI与IDE,成为Codex最大的使用入口。4月7日,Codex达到300万周用户;4月21日,又达到400万活跃用户。
这里最值得琢磨的不是某个功能名,而是信任半径。Agent不是一次性问答工具,它要读代码、改文件、调用工具、跑测试、跨步骤保持目标。如果用户不能在中途介入,就不敢把更长、更贵、更有风险的任务交给它。

Plan Mode解决的是“先想清楚再动手”;审批机制解决的是“高风险动作要用户确认”;任务分叉解决的是“不要把一个方向试错到死”;自动化和插件解决的是“验证过的工作流能不能重复调用”。这些都不如跑分性感,但它们决定了Agent能不能从玩具变成生产工具。
Tibo每新增100万用户就重置一次额度,也不只是送福利。它更像增长设计:模型发布制造注意力,额度重置把老用户拉回来,更多真实任务制造案例和问题,公开案例又吸引下一批用户。额度的价值,是让核心体验再次发生。
第三刀:把任务从电脑前搬到任何入口
4M之后,Codex继续往外扩任务半径。Chrome让Agent进入真实网页,手机远程让用户离开电脑也能下达任务,Goal Mode让任务目标更稳定,Appshots补过程证据,锁定远程任务补执行边界,Windows Computer Use扩大可操作环境。
到5月31日,公开里程碑来到500万用户。这个阶段的变化,比“又支持一个平台”更深。过去用户必须坐在电脑前陪着工具工作;现在任务可以在桌面发起、手机查看、远程继续。

这对开发者很关键。真正的Agent产品,不应该被理解成“一个聊天框里多了几个工具”。它更接近一个长期任务系统:用户发起任务,Agent执行任务,产品保存状态,用户回来验收,再继续分叉或修正。
如果你正在做AI编程产品,最好从一开始就把任务状态设计出来:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
只要任务跨设备、跨工具、跨几个小时,聊天记录就不够用了。你需要的是任务台,而不是消息流。
第四刀:增长单位从Codex变成Codex+Work
5M之后,增长慢了42天,直到7月12日才出现6M。表面看是产品放缓,实际是在等下一次统计单位变化。
6月,Sites、角色插件、banked reset、推荐机制、Record & Replay、Remote正式可用陆续补上;7月6日,iOS已经能直接创建、搜索、打开、分叉和管理Codex任务。任务不再被锁在一次本地会话里,而是拆成“发起、执行、查看、验收、继续”的长期状态。
7月9日,新模型全量上线,Sol、Terra、Luna覆盖不同成本层,max和ultra把单Agent扩展成多Agent协同。同一天,ChatGPT Work和统一桌面App上线,把Chat、Work与Codex放到同一入口。

这一步才是真正的品类扩张。7月12日的6M已经同时谈Codex与ChatGPT Work;7月13日的7M明确是两款产品的活跃用户;7月14日的8M也写成横跨Codex和ChatGPT Work。
所以后面的增长不能简单理解为Codex单产品突然暴涨,而是产品组合、额度激活和统计口径一起变化。增长对象也从“会写代码的人”,扩展成“有一件工作想交出去的人”。
开发者真正该抄的不是功能,而是四个半径
回看这条曲线,93张更新卡片本身不是重点。真正有效的是四个半径同时扩大。
第一是能力半径。模型从长任务、中途纠偏,到编码能力、Computer Use、超长上下文,再到Token效率、成本分层、多Agent协同,决定了Agent能做多难的事。
第二是任务半径。App把终端用户扩成桌面用户,浏览器和Computer Use把代码任务扩成真实工作,手机和Remote把“坐在电脑前”扩成“随时发起”。
第三是信任半径。Plan Mode、审批、Appshots、锁定远程任务、Record & Replay,让用户敢把更大、更久、更贵的任务交出去。
第四是激活半径。免费入口、里程碑重置、banked reset、推荐机制、公开案例,让发布日注意力变成一次又一次真实使用。
这四个半径叠起来,才是增长飞轮:模型跃迁点火,产品扩大任务半径,额度推动深度使用,案例与问题公开出现,团队快速修复,再吸引下一批用户。
对国内开发者来说,真正值得实践的是“Agent-First”的工作方式:不要只把AI当补全器,而要把需求拆成可执行任务,把上下文、工具、验证命令和回滚路径准备好。
常见问题
Q:Codex增长最快的原因是模型变强吗?
A:模型变强是起点,但不是全部。真正推动增长的是入口扩张、过程控制、任务状态、额度激活和双产品组合共同作用。
Q:为什么App比CLI更重要?
A:CLI服务的是熟练开发者,App把并行Agent、后台任务、审批和分叉做成可见界面,让更多人能理解和使用。
Q:AI编程产品最容易忽略什么?
A:最容易忽略任务状态。长任务必须能记录过程、展示差异、支持验收、允许分叉和回滚,否则用户不敢深用。
Q:Codex+ChatGPT Work说明了什么趋势?
A:Agent的边界正在从写代码扩展到研究、写作、分析和交付。增长单位不再只是开发者,而是所有有任务要完成的人。
- 目前还没评论,等你发挥!

起点课堂会员权益




