一个月10亿token,十年互联网运营的codex使用日记
两个月,3亿token,Codex已成为我的主力Agent工具。从数据更新到周报生成,它几乎包揽了所有标准化任务。但真正的智能并非来自提示词,而是SOP的沉淀、历史上下文的积累,以及AGENTS.md的精准维护。本文分享如何将AI从偶尔灵光的工具,打磨成可靠的数字分身。

两个月前,我开始将codex作为我的主力agent工具,查了下8月用量,截止到11号已经使用了3亿多token,照此趋势,本月token用量估计会破10亿。

使用codex的初衷,是希望搭一个Agent,替我把八成以上的活儿都包了,弄个24小时不停歇的「数字分身」出来。
两个月后,我把Codex最近百来个任务翻出来又看了一遍。
这些任务包括数据更新、周报生成、用户分层、财务对账、营收测算、专项课题、项目交接、系统后台自动化操作、产品提案、PPT和Word制作,连根据视频整理工作手册这种活儿都有。
直观点说,Codex确实已经插手了我大部分工作。可现在你再问我,那个能替我干掉八成活的「数字分身」搭出来没,我的答案还是没有。
不过这两个月下来,我对这件事的看法变了。(只能说AI发展太快,2个月就能有新感触)
我现在觉得,好用的Agent不是凭空掉下来的「数字员工」。它更像是一套一点点搭起来的工作系统,有的事能交给它反复跑,有的事得让它记得前因后果,还有的事,只能我跟它一句一句聊,才慢慢聊出个接近对的答案。
一、对于流程固定的标准任务,SOP才是王道
我在Codex上跑得最勤的,是个特别普通的数据更新任务。
这任务一开始的流程是这样的,从两个业务后台分别下载原始数据表,按表内ID合并去重,写进一张四十多万行的汇总表;再按名称补上周期、时间和分类等信息;然后按照一个规定的逻辑统计计算,将计算结果更新到一个数据总结表,同时把最新的汇总表复制到另一个文件夹,让另一个任务以这个汇总表为基础生成一份HTML的看板。
最开始,我每次都得给Codex写好几段的指令:
这是最新的汇总表,请使用data refresh skill,帮我刷新数据看板
这是某几天的原始数据,请使用 weekly-report Skill 更新汇总表和数据总结表。
这是我本周的主要工作,请帮我输出本周周报
跑的次数多了,我就想把整个流程再固化一下。专门做了份PPT,把两个后台各查什么、时间范围怎么定、重复订单留哪份、写入前后怎么校验,全写进去。
Codex照着这份PPT理解流程,提了几个模糊点,跟我确认完试跑了一遍。
试跑过程并不顺利。
有的Excel明明有数据,却因为文件尺寸标记不对被当成空表;20位的ID被表格工具当成长数字,变成科学计数法;新上的产品名称没有历史分类规则;数据写进看板,公式是对的,缓存却没刷,页面就显示错了。
但这些坑,挨个解决之后,后面就比较舒服了。
每踩一个坑,我就让Codex把解法写回Skill,ID必须按文本处理;未知产品先暂停确认;正式写入前必须备份;更新看板前抽一天的数据人工核对;写完还得检查公式、日期范围、重复订单和页面显示,异常数据监测报警等等.
最后,分别建在3个不同skill上,原本分了好几步的任务,变成了一个完整的Skill。
现在,我只要说一句:
这是我本周主要工作,帮更新数据到X月X日,生成周报
Codex就会自己定查询区间、查文件、合并去重、更新汇总表,中途暂停让我确认抽样数据,再接着更新看板。最后输出一份我给定标准格式的周报文档
所以,标准任务上Agent好不好用,跟提示词写得多漂亮基本没关系,核心是有没有一套跑通过、验证过的SOP。
做自动化最反直觉的地方在于,你越想偷懒让它自由发挥,它越容易出岔子。真正稳的做法,是把需要它临场发挥的地方压到最少。
一个适合丢给Codex反复跑的任务,至少得把五件事想明白:
- 输入是什么;
- 处理规则是什么;
- 输出到哪里;
- 如何判断结果正确;
- 遇到异常时应该怎么办。
这五件事还没想清楚,就别急着做Skill,更别急着上全自动定时任务。
先跟Codex一起跑通一遍,再跑第二遍,每次冒出来的新问题都补进SOP。等流程真稳了,它才从那个「偶尔灵光一现的AI」,变成一台靠得住的RPA机器。
这里多说一句,自动化任务中,如果是包含了浏览器操作的,比如登录某个系统从其中取数,或者此前我尝试过让codex按照我给定的SOP在系统上做一个重复性的配置。这里至少要关注两个问题:
1.浏览器操作的方式。目前codex操作浏览器大概有三种方式,一种是使用内置浏览器,另一种是借助chrome上的codex插件,直接控制本地chrome浏览器,最后一种就直接是computer use,全面接管电脑。这三种适用的情况不太一样,使用内置浏览器时,如果碰到需要从本地上传一个什么文件到系统内的情况,codex是无法完成的(至少我的电脑上无法完成,可能也有其他的解决办法可以做到),它无法直接调用本地的文件上传,所以每次都得手动去传,这样的话,其实就称不上是自动化实现了。使用chrome control其实是目前最方便的形式,一般只需要再登录的地方手动登录一下就可以了。至于computer use,其实个人不推荐,因为会打断正在进行的其他任务,而且经常会因为一些莫名其妙的权限问题卡住;
2.在浏览器内操作的重复性的配置任务,codex的效率在我看来其实称不上快,很多情况下不比人快。说实话,看着它操控鼠标在页面上过一会挪一下的样子,让我有一种指挥80岁老太干活的错觉。本质上,它其实是根据我做的SOP在模拟人的行为,让系统去模拟人的行为去操作系统,这就好比机器人放弃激光火箭导弹,反而想用武术打败敌人一样。
当然,agent如果只是一个聪明点的RPA,它的价值远远称不上革命性。
二、长期项目真正有价值的,不止是数据,更是那些历史上下文
除了固定流程,我用Codex最多的另一类任务,是围着同一个运营项目不断开新的分析。
先分析营收为什么掉,再测算下半年收入;顺着测算结果发现产品问题,接着定一个专项的提升战役;定专项又得分析用户数据、历史数据等;有一个方案了,和团队沟通策略需要调整,再按新的策略重新测算。
这些任务看着各管各的,其实是一条连着的链。
每次都开个空白对话,只跟Codex说「帮我做个方案」,它很容易甩给你一份四平八稳的标准答案。
不能说错,可对实际项目几乎没用。
真正有用的方案,得知道这个项目前几个月发生了什么、收入为什么掉、用户之前是啥情况、历史数据如何、哪些方案已经聊过、领导否过什么,还有眼下最重要的经营目标到底是什么。
后来我就刻意把每次分析产出的材料,都存进项目文件夹。
一次营收下滑分析,交付的不只是一份报告,还会变成后面一个专项策略的依据;一次数据测算,接着就是专项战役的目标底稿;一次用户分层,又成了用户触达和活动路径设计的输入。
时间久了我才反应过来,让agent变聪明这件事情,纯粹是它接新任务时能翻到更多验证过的旧材料,历史上下文,这个被很多模型研究者反复提到的概念,才是真正值钱的东西。
我觉得,一个长期项目的知识库,至少得存四类东西:
- 数据口径某个指标究竟怎么算,从哪里取的;
- 决策原因当时为什么选这个方案;
- 已验证结论哪些判断已经被数据或实际结果证明;
- 版本变化方案后来为什么调、调了什么。
很多人最容易盯着结论,可真正值钱的,是背后的「为什么」。
光告诉Codex「价格调到XXX」,它只记下一个冷冰冰的事实。要是同时记上「为什么调、目标人群是谁、这个策略扛的什么经营目标」,下次重新测算,它才更可能给出贴着项目实际的判断。
知识库也不是把所有文件一股脑塞进文件夹就完事。没有日期、没有结论、互相打架的材料越多,AI反而越容易懵。
给重要分析留个清楚的标题、时间和数据截止日期,再附一句结论。这么攒下来的知识,才真的能滚雪球。
三、AGENTS.md要更新,但不要把它写成项目日记
我刚开始用Codex时,做的第一件事就是建AGENTS.md。
这文件挺好用。它能告诉Codex我是谁、负责什么业务、习惯用什么语言、偏好哪种分析方式、重要资料放哪,最重要一点,我习惯的思考逻辑是怎样的,输出给我的文件需要按照什么样的逻辑来呈现。
可用得越久,我越发现AGENTS.md不能什么都往里塞。
比如某个商品现在卖多少、某次活动目标是什么、某个季度最重要的任务是什么,这些信息当时挺关键,几周后就变了。真要把它们写成全局规则,Codex往后还会把过期的东西当成铁律。
记忆多不代表聪明,记得太死,反而错得理直气壮。
我现在更习惯把Codex的上下文切成四层,
- AGENTS.md长期稳定的身份、偏好、原则和资料入口;
- Skill某一类任务应该怎样执行;
- 项目知识库不断变化的业务历史、分析材料和决策记录;
- 当前对话本次任务特有的目标、条件和最新变化。
要判断一条信息该不该写进AGENTS.md,有个土办法,
三个月后,这句话大概率还成立吗?
答案是否定的,就老老实实塞进带日期的项目文档,别写进Agent的「长期人格」里。
AGENTS.md这东西,我把它当公司的基本制度来用,不是那种天天改的工作日志。定期看一眼,每次改都得悠着点。
四、Codex能一次生成漂亮文件,但很难一次生成真正属于你的观点
Codex生成的Word、Excel和PPT通常都挺好看。
结构完整、内容够多、图表齐全,标题和金句也写得有模有样。也正因如此,它产出的东西特别容易被挑「AI味太重」。
问题不一定在它写得差,反倒是它写得太满了。
一份看着啥都有的方案,特别容易把几个要命的问题盖住,核心判断到底是什么?数据真撑得起这结论吗?哪些内容只是行业常识?这方案跟别的公司有啥区别?最后到底要领导拍什么板?
前阵子做一份方案,第一版就已经有完整的行业分析、产品运营、活动方案和商业化设计。可我自己改、跟客户聊、再回Codex修改调整,文件从V1一路改到了V8。我让codex统计了一下,前后我给他发过35条消息,加起来写了6377个字。

另一份方案同样经历了初始版、精简版、修订版、第三次修订和第四次修订。用户规模变了要重算;商品策略变了要把原来的结论推倒重来;跟领导聊完,最终汇报逻辑又得重新组织。前后将近20轮对话输出,写了快4000字。

这些经历越攒越多,我越来越确定一件事,
Codex给的第一版,我不再当成答案,只当成一块写得很满的白板,拿来跟它接着吵。
它确实能很快把零散想法捋顺,可真正属于我的那部分,是在后面反复较劲时才长出来的。
- 这一页究竟想让听众得出什么结论?
- 这个数字的依据是什么?
- 哪些内容只是正确的废话?
- 哪个假设最容易被领导或客户质疑?
- 哪些内容可以直接删除?
- 这到底是Codex的判断,还是我自己的判断?
要是你只管跟Codex说「再优化一下」「写得更专业点」,它通常只会吐出更多字、更漂亮的话。
真正管用的改法,是明明白白告诉它哪里不对、为什么不对,还有你自己现在偏向哪个判断。
AI的第一稿能力确实强,但最后那点取舍、判断和责任,还是得人自己扛。
五、我现在怎样理解Agent
此前,我把Agent理解成「大脑、工具、Skill、知识库和记忆」的组合。
这个理解现在还成立,不过我得补上最重要的一块,人。
Agent的大脑管理解和规划,工具管操作文件和系统,Skill管规定标准流程,知识库管提供项目背景。而人,管的是定目标、做判断、背责任。
之前我喜欢用「消失的筷子」打比方理解Agent,用户只管说「我想吃肉」,中间拿筷子夹菜的过程根本不用看见。
现在我觉得,过程并没有真消失,只是从每次执行任务时,提前到了设计Agent的时候。
第一次搭那个每日数据更新流程,我花的时间比自己手动更新一次多太多了。可流程一旦跑通,后面每次执行都变得特别轻。
说到底,Agent最擅长的,未必是替你想清楚一切。
已经想清楚、规则也稳的事,它能不厌其烦地稳定跑;还没想清楚的事,它最值钱的作用,是飞快把想法变成你能看见的方案,让你接着去质疑、比较、改。
对我而言,Codex现在身兼好几个角色,
标准任务里它是RPA,分析时它是助手,长期项目里它是外置记忆,聊方案它是陪练,做起文件又快又猛。
但它还远不是一个能撒手不管的数字员工。
对于还没深度使用过agent的人来说,我建议先挑一项每周都重复、流程相对固定、结果好核对的实际工作。
先让Codex陪着完整地做一遍,把输入、输出、规则、校验和异常处理写清楚;再做第二遍,把冒出来的新问题补进去;等连续稳定跑了,再把它封成Skill或者自动化任务。
同时,给长期项目建清楚的文件结构,把重要分析、数据口径、决策原因和执行结果持续存下来。
AGENTS.md只写真正长期稳得住的信息,隔段时间检查一次,把过期的规则删掉。
至于方案、报告、PPT,我会默认Codex给的永远只是V1。先让它飞快搭出完整框架,剩下的时间,全花在反复沟通、挑战假设和砍内容上。
两个月前,我以为下一个时代的钥匙,藏在我们向AI提的每一个问题里。
现在我觉得,问题只是个开始。
真正拉开差距的,是你能不能把一次有价值的对话,沉成一套能复用的流程;把一次分析的前因后果,攒成一个还在长的项目知识库;再把AI给的第一稿,用自己的判断,改成真正算你自己的东西。
这可能才是普通人用Agent最现实、也最有价值的一条路。
本文由 @秦齐 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




