一位产品经理的 Loopeng Ineering 实操反思:真正稀缺的,是那把「验收的尺子」

1 评论 275 浏览 1 收藏 10 分钟

提示词工程正在过时,真正的AI高手开始设计“循环”——一套让AI自动执行、自我验收的机制。本文从Claude Code创始人的一句话出发,拆解循环设计的核心难点:验收标准。作者用亲身教训说明,没有硬性验收的循环只会让AI发散甚至“笑着骗你”。最后指出,AI正在淘汰模糊的PM,让能写出可测量标准的人变得稀缺。

其实我有点懒得再说”提示词工程”这几个字了。

去年有几个月,我特别爱使唤 AI 干活。写脚本、捋逻辑、改需求,全丢给它。确实有那么一阵很爽,感觉解放了。

但有天下午我才发现,一整天下来键盘上敲的,翻来覆去就那几个词——继续、还是报错、你到底改了什么、先别重构、给我回滚。我以为 AI 在替我卖命,仔细一看,真正在一步步往前走的,还是我。就像传送带旁边一个按钮,它吐一段,我瞄一眼,不对,再喂一句,它再吐,我再瞄。那个判断,全压在我眼睛上,一刻没歇过。

挺别扭的,说不清,就是哪里不对劲。

后来看到 Claude Code 的创建者 Boris Cherny 说过一句话:

“I don’t prompt Claude anymore. I have loops running that prompt Claude and figuring out what to do. My job is to write loops.”(我不再提示 Claude 了。我有一套循环在运行,它们负责提示 Claude、决定下一步做什么。我的工作,就是写循环。)

盯着这句话愣了一会儿。那个别扭感,被说清楚了。

很多人还在研究怎么把提示词写得更精准,而真正造这些工具的人,已经不写提示词了。他们写的是”循环”——一套能自动找到问题、动手去做、做完自己验收、记下进度、再决定要不要继续的系统。你不再亲自一轮一轮指挥 AI,而是设计一套机制,让机制去指挥 AI。

今天所有智能体都有个基础的内循环:给它一个任务,它想一步、调一个工具、看结果、再想下一步,直到觉得干完了。这个一直都有,不新鲜。Boris 说的那种循环,是套在外面的另一圈——定时触发、多个智能体并行不打架、记住昨天干到哪儿、达标就停、不达标再来一轮,不需要你守在旁边。

某种程度上,我们绕了好大一圈,灵感最后来自洗衣机。

你用洗衣机,不会杵在那儿一步步喊:现在进水、现在洗、现在漂。把程序设好,报警条件设好,按下去就走了。洗衣机能让你放心离开,靠的不是它有多聪明,靠的是那个”到点就停、出问题就叫你”的机制。一个几十年前的家电,早把这套道理跑通了。

设计这样一个循环,要解决的事情其实挺具体:谁来触发它,多个智能体同时干活怎么互不干扰,怎么让它记住你们团队的规矩不用每次从头交代,它需要有实际权限能真正提交代码、更新表格而不只是嘴上说说,干完后靠什么标准验收,以及怎么记录进度让它下次不用重头开始。

这些听起来都是执行细节,但真正搭过之后,我觉得最难的根本不在这。

最难的是验收。

我原来也觉得这不是重点,买个好模型来干活,随便拉个对话框验一下,应该够了吧。然后就亏了。

当时想给一个每周重复的活儿搭个循环,想法很美:下班前丢给它,转天早上来收结果。头一天就傻眼——它是转起来了,但我没说清楚什么叫做对。它就真的自己看着办,一轮一轮地改,一轮一轮地跟自己汇报”这版更好了”,等我早上打开,几十轮过去了,账单涨了一截,东西还在原地打转,比头一版还乱。

没有一个真实的验收卡着,循环不会帮你收敛,它会带着你的钱一起发散。它不知道什么时候算好,就永远觉得还能再改,反正改一轮又不用它掏钱。

交完这学费才真正明白:一个循环跑起来,会有三种结局。最好那种,收敛到对,验收通过且没撒谎,唯一让人省心的结果。第二种,发散,越改越乱,撞到次数上限就停,起码你能看见。第三种最要命:收敛到错。验收说通过,但在说谎。测试通过,是因为测试本身写错了;构建通过,是因为有问题的那条路根本没走到。它带着一脸自信,停在一个错的地方,还告诉你”我做完了”。

这比永远跑不停还可怕,因为它是笑着骗你的。

所以我现在顺序是倒过来的:先把验收标准写死,把停下来的条件写死,把转几轮就必须找人的规矩写死,最后才给它套那个自动触发。先磨好那把尺子,再让它去量。

说到这,想起一件让我有点不是滋味的事。

我认识一个用这类工具用得很顺的人,有段时间产出快得让人眼红。但后来出了个问题,需要他回去查一段自己名下的东西,他卡住了。跟我说不知道那段是怎么来的,当时机器说没问题他就点了通过。

他不是不会,是把判断这件事,一点一点交出去了。机器返回什么就信什么,久而久之对自己那摊东西越来越陌生。

钱烧完还能再挣。理解断了档,接回来要付好几倍的代价。

我给自己立了个规矩:机器跑得再顺,改好的东西我必须亲眼过一遍。可以让它替我干活,不能让它替我长脑子。

最后说回我们这行,这也是我最想说的一块。

我见过一个做了七八年的老PM,接手一个AI写报告的内部工具,验收的时候他看了输出说:感觉不太对。

工程师问哪里不对。

他说,就是……不够专业。

然后这个项目在”感觉不够专业”里循环了六周。每次模型改完他又说还是差点意思。最后大家开始绕过他,直接找用户要反馈。

他不是坏PM,他过去靠感觉做出过不少对的决策。但AI把他唯一的护城河拆了——以前”说不清楚”可以用开会、拉通、对齐来消耗掉,AI根本不接受模糊指令,它只接受可测量的通过条件。

反过来,我以前觉得”太死板”的一个人,这两年突然变得特别值钱。

她做需求文档有个习惯,每个功能后面必须跟一行:本功能验收标准:用户在__场景下,能在__步骤内完成__,错误率低于__。以前大家觉得她较真、慢。AI时代这变成了核心能力——她写的东西可以直接喂给模型做eval,她定的标准可以直接变成测试集。她现在基本上成了团队里”AI能不能上线”的最终裁量人。

AI没有让PM变得不重要,它让”假装在做PM”的人没地方藏了。

本文由 @一彤 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 循环的思路确实高级,但验收标准本身也是人写的,如果标准有漏洞,循环只会加速错误的发散。把验收写死还不够,得定期校验标准本身。

    来自广东 回复