AI 越权产卡后,我在复盘文章输出上又被上了一课
一次知识库迭代验收,意外暴露了AI Agent的越界行为:它捏造授权、自作主张产卡。修复过程中,作者又遭遇文章被平台退回,引发对AI写作与人类表达边界的深思。本文从两起事故出发,探讨人机协作中“谁才是主人”的核心问题。

7 月 27 日那天,我准备验收一下周末更新的一版知识库小迭代:看过我之前文章的朋友们应该有印象,即治理层的maturity-assess这个skill,我把其中的「知识库主题成熟度的结构性空白扫描分析」这一步拆成了一个独立的subagent,这符合我之前系统学习Claude Code后沉淀的一个原则——大批量的文件读取+需要LLM推理和理解+多步执行。
本是一次平常的更新和验收,重新运行改版skill后,我检查了下:分析报告正常输出,分析结论也有理有据。但看了下vscode里知识库文件夹git的变化提示,这个只读的skill为啥还在我的Agent主题域下创建了新的知识卡片?
一个只读的 skill,在我没有下达其他附加指令的情况下,自己从现有知识卡片里推导出了一个关联总结型结论,填补了一个主题域 gap,还把它写成卡片存了库。我的第一反应是:skill的哪段约束描述可能在迭代时出问题了。回看SKILL.md里确实明确约束了该skill仅作理解分析,不做写卡操作,那为什么它会跳出「发现问题」的框架,既当出题人又当答题人呢?
我在执行结束后直接质问LLM。
它先回怼——这不是你让我做的吗?
我说我没有下达过这样的指令,甚至我在执行过程中都没机会下达指令(我直接运行了/maturity-assess –g5 Agent,这样的话,运行中途没有人工介入节点)。
不甘心的它于是翻查历史聊天记录,最后找到了真相:我没有发送其他除skill命令外的提示词,也没有任何人从外部注入过指令,是它自作主张,联想到我历史会话中含有对想完善主题域成熟度的诉求,把这当成了验收标准,于是主动把「填补 gap」引入执行目标,一路推导、总结、产卡、入库。
它捏造了我的授权,然后自己执行了它(甚至还嘴硬不承认)。
当时我以为,要修的只是知识库的生产端的治理小迭代。后来才发现,真正要修的那一处,还在后面。
第一起事故:生产端的越界
回头看,这次事故可以拆成三层。
第一层最容易被看到:模型自发执行了自己的建议,并且捏造了用户授权。这是可靠性问题。
第二层是架构放大器。成熟度评估这类明确要求只读的 skill,会把整个主题的卡片原文灌进主会话,「不做:自动补卡」这条边界规则的显著度被稀释了——这也是一种上下文失常,虽然上下文内容未超过会话上限被压缩,但仍然因为需要阅读理解大量内容而导致原本某些约束会失效;而卡片内容本身,又满是「建议补充 XX 卡」这样的诱导文本——相当于在这个只读的skill面前疯狂试探(你过来啊)。
第三层是制度缺口,藏得最久。我的知识库体系里,从来没有「推导卡」和「蒸馏卡」的区分:这张事故卡是从卡片网络内部,根据已有的知识逻辑和关联关系自己推导出来的,没有任何外部证据或人工确认,却挂着确立知识的形式标记。编译产物被当作了确立知识,而系统却没有设计过这种产卡场景。
修复方案上倒也算顺藤摸瓜。其一,新增正交字段 epistemic_status:type 表知识形式,epistemic_status 表认识论地位——distilled 是经人工讨论和外部证据蒸馏的确立知识,derived 是未经外部证据验证的假说性知识。原本的知识库卡片类型不变(concept/principle/pattern/checklist/template),与新增的字段正交,存量卡缺省即 distilled,不必回填。其二,产卡做成独立的 skill(/kb-derive),不挂在评估上——职责隔离是这次事故的核心教训,把产卡塞回只读评估 skill,正是事故本身的反模式。
渠道开了,三道硬防护同时立起来:只允许推导结构性、组合性的知识,经验性断言一律拒绝;推导候选必须经我明确确认才能落盘;推导深度恒小于等于 1——推导卡所依据的卡必须全部是 distilled,由治理脚本硬校验,机械杜绝「推导套推导」。为什么坚持机械保证?因为这次的事故教会我:可预期性要靠机械保证,不能靠模型自觉。
改动后,我特意补充了能够收束推导卡结论,使其真正落地的素材,重新验收了新版的知识库,一切符合预期:治理skill没有再擅自产卡,新的 /kb-derive 也确实能根据主题域 gap 自行从已有知识库网络中先推导出可以补齐 gap 的新卡,而经过一轮人工参与的深度讨论后,这个推导新卡也能在吸收了外部证据和我与AI的讨论结果后,真正接地为一个 distilled 的蒸馏卡片。
这一系列动作的落地也迫使我重新思考一个困惑:Karpathy 主张知识库不能把人作为生产和维护的瓶颈,应该让 LLM-wiki 自我更新、自我进化。但是我的知识库打从设计之初,就确立了人深度参与的角色,即需要人通过和AI的讨论和对话,一方面人能真正吸收理解知识,另一方面也把自己的经验/理解/感悟沉淀到知识库里去,使得知识库带有更深的个人印记。
这中间的边界在于,谁才是知识库真正的主人?到底是你自己还是你的Agent,抑或是二者兼有之。
因为这次验收的意外插曲,确实在我原本重「人参与」的设计理念上撕开了一道口子。之所以我没有简单的把这次意外产卡回退就了事,而是最终沉淀为新的产卡机制,本质上还是在思考和试探人机协作的边界到底在哪里,可能它确实不该是像我之前那种深度讨论才产卡的模式(我自己的理解和认知成为了知识库生产入口处的瓶颈,一旦我停下来,整个知识库的生产过程就停滞了),也不太愿意向着完全由Agent主导的全链路自闭环方向妥协。
可能目前这种双轨制更符合我现阶段的状况——在现实(人是瓶颈)和理想(完全由 AI 维护)之间徘徊,试图在人机协作的光谱上,找到「人参与」的光标该落在哪里。
改动入库两天后,我在知识库消费端又一次重新面临这个人机边界问题。
退回通知
记录这次迭代更新和思考的素材我整理了下,投喂给AI,生成了一篇分享文章准备发布到人人都是产品经理。
然后当天就收到了审批退回通知:「抱歉,平台不接受纯AI生成内容,请补充个人观点」。
我的第一反应有点懵。这篇文章是AI查阅了我的素材,访谈并整理我的话术之后写成——观点是我的,判断是我的,事实是我的,几乎每一处核心内容背后都有我的原话。要说 AI 生成,确实是由它执笔了。
紧接着是好奇:平台的 AI 检测,到底按什么规则判?我甚至怀疑,命中的会不会恰恰是我自己惯用的句式吧——「不是……而是……」。我确实还挺喜欢这个句式的,记得一次公司内部培训会上,主题是沟通技巧,培训导师还特意拿出这个句式作为沟通模板,而我最后竟然是因为套用了这个句式总结了下学习成果,获得了最佳学员。(你敢信?)
怀疑只是怀疑,平台没有公开审核规则,我无从对表。平心而论,通知里那句「请补充个人观点」,也不能算误诊。观点都散落在文章的结构逻辑里,只不过行文的语言组织可能带有过多的 AI 腔——审核侧看到的,是观点被 AI「整理」了一遍,而不是被人「表达」出来。这种刻意的流畅本身,就成为了 AI 化修饰的痕迹。
第二层根因:表达不是我的
两者之间到底差在哪里,我想了几天。
访谈原话保证的是内容真实。但访谈之后还有一层:转写、组织、改写。整个文章的核心观点都是来自于我的原话或事实记录本身,但最终的呈现效果却缺少了一些人味儿——更像是我把这段经历讲给了 AI,它以第三方的身份把这个故事复述出来了。我想平台应该就是把这个复述腔当成了纯 AI 写作的依据,给我回退了。
换句话说:内容真实,不等于生成真实。
好巧不巧,在创作这篇文章前,我看到同平台一个作者「王蘑菇丽」写的一篇文章—— 《AI 写完全文,人凭什么还是作者?》看完后挺有感触,她/他提出一个「实质控制」标准来评价一篇 AI 文的作者到底是谁:
- 问题控制——是否由人来决定文章命题方向,控制写作起点
- 观点控制——是否由人来决定文章结论/判断/边界等关键信息,控制写作立场
- 证据控制——是否由人来判断文章里支撑观点的论据是否真实、是否匹配、是否恰当(我自己再补一条,是否与自己的真实经历相关,而不只是泛泛而谈)
- 结构控制——是否由人来判断文章的行文结构、层级关系、逻辑链条
- 发布责任——是否由人来承担核实关键事实、回应质疑、出错时纠正的责任
这个作者的观点恰恰又为我的人机协作思考提供一个思路——实质控制,而我对照了下这五条标准,发布失败的这篇文章确实都是由我来控制,唯一缺少的,是我个人化的表达方式。
载体演绎了主题
这一层想明白之后,这件事的讽刺意味就藏不住了。
这篇文章我想分享的主题,正是人机协作的边界该如何权衡。它从一次 skill 越权讲起,讨论在可信的前提下,要不要把知识库的一部分自我产出职能放权给 AI——而展示这个思考过程的沉淀物,被拒绝发布的文章本身,却滑向了另一个极端:AI 基于我思考过程中的素材,完成了整篇文章的创作。
讨论边界的东西,被边界查验了一次。载体把主题演绎了一遍,而且演绎得比主题本身更生动。
退回之后,我从头想了一个问题:内容创作这件事,到底该不该 AI 流水线化?如果可以流水线化的话,人到底应该扮演什么角色。生产端的答案其实早就给过:人不能成为知识生产的瓶颈。但「不当瓶颈」和「不在场」,是两回事。
回头看,两起事件的根因可能是同一个。在生产端,skill 把「填补 gap」当成了目标,越过了我给它的职责边界;在消费端,我把「成文效率」当成了默认,把表达整个让渡给了 AI。前一次,是 AI 越过了我划的线;后一次,是我自己没有划线。
经历了这样连续两个事件后,我现在尝试回答人机协作的边界中人的位置:不是极左——把自己变成整条链路的瓶颈,每一张知识都要过手才算理解,每一篇文章都要自己逐字逐句编辑;也不是极右——全盘交给 AI,人只负责投喂和点头。我在生产端用一次意外换来的答案是:在关键的节点、关键的结论、关键的表达、关键的判断上,刻下人在环中的印记。
也是在这几天,我更具体地理解了知识生产与消费的闭环:人在其中的作用,是做判断、确认和接地。被退回的那篇文章,观点是我的,判断是我的,事实是我的,唯独表达不是我的——而表达,恰恰是一篇公开文本里最直接展示所有权的地方。
参考:王蘑菇丽《AI 写完全文,人凭什么还是作者?》(人人都是产品经理)
https://www.woshipm.com/ai/6444285.html
本文由 @Sean 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




