从目标到可靠交付:复杂 Agent 的执行、反馈、协作与记忆体系
当Agent被要求完成“读取售后数据、分析问题、生成报告、审批后发送邮件”这类复杂任务时,单一Prompt往往力不从心。本文深入拆解固定工作流、自主规划、多Agent协作、反馈机制与Memory等核心概念,揭示如何通过流程控制与人工审批构建可靠、可控的智能体系统。

假设用户要求 Agent:“读取最近30天的售后订单和客服记录,分析主要问题,生成管理报告,保存为文件,并在负责人审批后发送邮件。”
这不是一次简单问答,而是一组相互依赖的任务:系统要理解指标口径,通过 Tool 或 MCP 查询实时数据,必要时通过 RAG 检索售后制度,完成分析和写作,检查结果,保存进度,并在人类审批后执行发送操作。
如果只把所有要求写进一个很长的 Prompt,模型可能在任务后期忘记早期约束,也可能把错误数据包装成结构完整的报告。复杂 Agent 的关键不是让模型“想得更多”,而是明确:谁负责执行、步骤如何组织、错误如何发现、状态如何延续,以及何时必须停止并交给人类。
一、核心关系:这些概念不在同一层级
固定工作流、自主规划、单 Agent、多 Agent、反馈和 Memory 分别解决不同问题。
- 组织层决定“谁来做”:由一个 Agent 负责,还是多个 Agent 分工。
- 执行层决定“怎么做”:按照预先设计的步骤执行,还是根据环境动态规划。
- 保障层决定“如何保持可控”:通过反馈纠错、Memory延续状态,并在高风险节点加入人工审批。
它们不是从低级到高级的演进路线,而是可以组合的系统能力。例如,单 Agent 可以按照固定流水线工作,也可以自主规划;多 Agent既可以接受 Leader统一分工,也可以围绕共享空间协作。

在月度售后分析案例中,主流程可以固定为“取数—分析—写作—验证—审批—发送”,但当订单接口失效或字段发生变化时,允许 Agent在受控范围内重新规划。这通常比完全固定或完全自主更可靠。
二、单 Agent 为什么容易在复杂任务中失控
单 Agent 的优势是上下文统一、沟通成本低,适合范围集中、链路较短的任务。但当它同时承担数据查询、业务分析、文稿生成、质量审查和邮件发送时,容易出现三类问题。
第一是注意力遗忘。例如任务最初要求“只统计已完成的售后单”,但随着客服记录、制度资料和工具结果不断进入上下文,模型可能在生成报告时忽略这一口径。
第二是错误级联。如果第一步把“申请时间”误当成“完成时间”,后续趋势分析、问题归因和管理建议都会建立在错误数据上。最终报告越完整,错误反而越难被发现。
第三是扁平化理解。模型可能把“查询数据、分析原因、生成报告、检查质量、发送邮件”理解为同一层任务,而没有意识到:数据没有通过验证就不能进入分析,报告没有审批就不能发送。
问题根源不只是“只有一个 Agent”,还包括上下文过载、依赖关系不清和缺少验收门槛。简单增加 Prompt 长度只能补充要求,不能代替流程控制。
三、反馈:让执行形成可纠正的闭环
反馈的作用是回答两个问题:当前结果是否达到标准,如果没有,下一步应该重试、重新规划还是停止。
自我反馈是让模型检查自己的输出,适合发现结构缺失、表达问题和明显冲突。例如报告生成后,再要求模型检查是否包含数据范围、核心指标和管理建议。也可以把写作与审查拆成两次调用,让审查角色专注检查规范。
但自我反馈仍有局限。写作者和审查者如果使用相同模型、相同资料,可能共享同类偏差。“模型认为正确”不能等同于事实已经验证。
外部反馈来自真实环境,例如数据库返回的记录数、统计程序的计算结果、规则引擎的检查结论、文件是否成功生成,以及邮件接口的响应状态。它回答的是“事实证明是否成功”。
人工反馈适合模糊、高价值或不可逆操作。本例中,报告可以由 Agent自动生成,但涉及敏感数据和对外发送时,应先由负责人确认指标口径、收件人和附件内容。
在固定工作流中,反馈是进入下一阶段的验收门槛;在自主规划中,反馈是调整计划的依据;在多 Agent 中,反馈则是成员成果进入最终汇总前的质量控制。
四、五种常见的工作流与编排模式
以下五种方式并非互斥方案。一个真实系统可能同时使用流水线、分支、并行和 HITL;MoA则更接近多模型集成策略。
1. 流水线:强调顺序和依赖
流水线要求前一步输出严格进入下一步。本例可以按照“读取订单—清洗数据—分析原因—生成报告—质量检查”执行。数据没有通过完整性检查,就不能开始分析。

它适合路径稳定、依赖明确的任务,优势是容易审计和定位错误;风险是前期错误可能沿流程传播,因此每个关键阶段都应设置验收条件,而不是只在最后检查。
2. 分支选择:不同问题进入不同路径
分支模式由规则、分类模型或 Router Agent判断输入类型。例如系统发现售后原因主要是物流超时,就把相关记录交给物流分析模块;如果是商品破损,则交给质量分析模块。

它适合问题分类清晰、不同类型需要不同专业能力的场景。风险是路由错误会把任务交给错误专家,因此需要为“无法判断”和“跨类别问题”保留兜底路径。
3. 并行执行:降低互不依赖任务的总耗时
数据准确性、报告结构、语言表达和权限检查彼此没有强依赖时,可以同时执行,最后统一汇总。

并行的主要价值是缩短总耗时,但前提是子任务可以独立完成。最终还需要统一的合并标准,否则多个结果可能相互矛盾,甚至出现“每个检查都通过,但整体不可用”。
4. MoA:用多种结果提高质量
MoA(Mixture of Agents)可以让多个模型针对同一批售后数据独立提出原因分析,再由聚合模型比较、筛选和融合。

它主要追求结论的多样性、质量和鲁棒性,而不是节省时间。多个模型也可能共享训练偏差,因此聚合不能代替真实数据验证。如果这些模型只生成候选答案,没有持续状态、工具调用和行动闭环,它更接近模型集成,不一定属于完整多 Agent。
5. HITL:在关键节点把控制权交给人类
HITL(Human in the Loop)不是单独的任务流程,而是一种治理机制,可以插入流水线、分支或自主规划中。

本例中,Agent完成报告并检查格式后,应在发送邮件前暂停。负责人可以批准、退回修改或补充信息。特别是涉及财务结论、客户隐私和外部操作时,人工审批比事后纠错更重要。
五、自主规划:从执行固定动作转向追逐目标
固定工作流适合已知路径,但现实环境可能变化。例如订单接口暂时不可用、字段名称调整,或者客服记录缺少必要信息。如果事先穷举所有异常分支,系统会越来越复杂。
规划型 Agent 接收的是高阶目标,而不是单一动作。它会拆分任务、选择工具、跟踪状态,并根据真实反馈调整计划。

如果订单接口失败,Agent可以先识别错误,再检查是否存在授权的备用数据源,并调整后续分析步骤。但权限、数据范围、最大步数、预算、超时和停止条件不能由 Agent随意修改。
如果系统允许 Agent动态生成临时工具,也必须在隔离环境中限制可执行语言、网络、文件、依赖、凭证和运行时间,并在工具通过测试后才能使用。
生产系统更适合“固定骨架+局部自主”:主流程、权限和验收标准固定,检索策略、工具选择和异常恢复允许动态调整。
六、多 Agent:两种典型协作结构
当任务跨越数据分析、业务判断、内容写作和质量审查时,可以通过多 Agent 隔离上下文和专业责任。
Leader—Member 分层模式
Leader Agent理解目标、拆分任务、分配成员、跟踪状态并汇总结果。数据分析 Agent负责统计,业务审查 Agent检查指标口径,写作 Agent生成报告,验证 Agent检查证据和格式。

它的优势是责任明确、上下文聚焦;风险是信息经过 Leader转达可能延迟或失真,Leader也可能成为瓶颈。如果成员分别写出内容再简单拼接,最终报告还可能缺少统一叙事。
共享空间共创模式
多个专家围绕同一份分析记录读取、补充和修订,没有单一中心持续转发信息。数据专家发现物流异常后,业务专家可以直接补充制度解释,写作专家据此调整结论。

这种方式适合开放性分析和灵感碰撞,但讨论容易发散,通信 Token 和时延也更高。因此需要明确共享空间的数据结构、修改权限、冲突处理和收敛标准。
真实项目可以混合使用:先让多个专家在共享空间发现问题,再切换到 Leader模式分工执行、验证和交付。
七、Memory:让 Agent 在无状态调用之间保持连续性
大模型通常是无状态的:一次调用结束后,不会自动记住此前内容。Agent 的“记忆”实际上由应用保存,并在后续请求中选择相关信息重新提供给模型。
需要先区分两个层级:
- 短期记忆与长期记忆描述信息保存和使用的范围。
- 窗口截断、滚动摘要、向量检索和主动管理是实现与治理方法。
短期记忆:维持当前任务的连续性
短期记忆主要保存当前会话需要的信息,例如近期对话、任务目标、关键约束、工具结果和执行状态。它通常通过上下文窗口实现:应用将相关历史重新放入下一次请求。完整保留所有历史会增加 Token 消耗,还可能造成上下文超限、注意力稀释和关键信息难以定位,因此需要压缩和筛选。
固定窗口截断:只保留最近若干轮消息或指定数量的 Token。它简单、成本低,适合闲聊和信息价值快速衰减的场景;风险是早期目标和关键约束可能被直接丢弃。
滚动摘要:将较早内容压缩成摘要,用摘要替代原始历史,同时保留最近消息。它适合项目规划、长篇创作等长期任务;但会增加处理成本,摘要遗漏也可能影响后续判断。
两种方法解决的都是:如何在有限上下文中延续当前任务。
长期记忆:跨会话保存可复用信息
长期记忆用于保存会话结束后仍有价值的内容,例如用户偏好、项目进度、关键决策和可复用经验。这些信息通常存储在模型之外。新任务到来时,系统检索相关记忆,再将其放入短期上下文。完整过程是:持久化保存 → 按需检索 → 放入当前上下文
结构化存储:适合姓名、偏好、项目状态等字段明确、需要准确读取的信息,具有稳定、可修改和可审计的特点。
向量化召回:将对话或项目记录转换为向量,根据语义相似度检索相关历史。它适合非结构化内容,但具有概率性:已经保存不代表一定能被召回,语义相似也不代表内容仍然有效。
因此,结构化存储与向量检索通常需要组合使用。
主动记忆管理:管理记忆生命周期
主动记忆管理不是另一种记忆,而是同时作用于短期和长期记忆的管理机制。系统需要决定:
- 什么值得记录以及采用什么形式;
- 什么时候检索、更新和删除;
- 如何处理冲突与过期信息;
- 用户能否查看、修改和删除;
- 哪些隐私信息禁止保存。
Agent 越主动,越需要严格的写入规则、权限控制、有效期和审计机制。
记忆的能力边界
记忆也有明确边界:固定业务规则和安全约束不应依赖概率性的记忆召回,更适合放在系统规则或权威知识库中;制度资料可以通过RAG检索;订单、库存等实时信息应通过Tool或MCP查询。Memory负责连续性,但不能替代规则、知识库和实时数据源。短期记忆支撑当前任务,长期记忆保存未来可能复用的信息。长期记忆只有被检索并放回当前上下文,模型才能在本次调用中使用。
八、如何选择合适的组合
- 路径清晰、任务集中:单 Agent+固定工作流。
- 路径清晰、跨专业:多 Agent+固定分工。
- 路径未知、任务集中:单 Agent+自主规划+外部反馈。
- 路径未知、跨专业:多 Agent+分层规划+严格治理。
- 高风险操作:无论采用哪种组合,都加入外部验证、HITL和停止条件。
- 长任务或跨会话任务:增加短期状态、长期记忆和主动治理。
架构不是越复杂越好。增加 Agent、规划能力或记忆系统都会带来额外成本、延迟和治理风险。只有当任务复杂度、专业跨度和复用价值足以覆盖这些成本时,才值得引入。
小结
单 Agent与多 Agent决定“谁来做”,固定工作流与自主规划决定“怎么做”,反馈决定“做得对不对以及是否需要调整”,Memory决定“跨步骤和跨会话如何保持连续”。
真正可靠的 Agent 系统,不是让模型拥有最大的自由,而是让任务在清晰的责任、步骤、证据、状态和停止条件下逐步完成:能自动执行的自动执行,需要验证的及时验证,风险过高时把控制权交还给人。
本文由 @Grace 原创发布于人人都是产品经理,未经许可,禁止转载。
题图来自Unsplash,基于 CC0 协议。
该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。

起点课堂会员权益





复杂Agent要跑通“取数—分析—报告—审批—发送”这类任务,单一Prompt解决不了。它真正要回答的是:谁来做、怎么做、怎么纠错、怎么延续状态,以及什么时候必须停下来。正文把组织层、执行层、保障层拆开,判断是“固定骨架+局部自主”最可靠。最后落到的点很实际:人工审批不是拖后腿,而是复杂任务里让系统保持可控的必要成本。