当 Claude 开始打包金融 Agent,垂直 AI 不能再靠“更懂行业”

0 评论 290 浏览 0 收藏 23 分钟

Anthropic 与 OpenAI 相继发布金融 Agent 模板和角色插件,将行业知识、数据连接与任务分工打包成标准组件。垂直 AI 产品的传统优势正在被平台吞噬,真正的壁垒已从“更懂行业”转向“对结果负责”。本文深入拆解这一趋势,探讨垂直 AI 的生存之道。

2026 年 5 月,Anthropic 一次发布了 10 套金融 Agent 模板,覆盖投行材料制作、财务建模、市场研究、KYC 审查和月末关账等任务。每套模板都预先组合了行业知识、数据连接和任务分工,企业可以直接安装,也可以按照自己的流程继续调整。

不到一个月,OpenAI 也推出了面向股票研究和投资银行的角色插件。其 6 类角色插件总共打包了62 个应用和 110 项 Skills,可以读取专业金融数据、分析可比公司,并直接生成客户材料。这对垂直 AI 产品提出了一个很现实的问题。过去,行业创业公司通常把“更懂金融”“接入专业数据”和“沉淀业务流程”当作主要优势;现在,基础模型厂商正在把这些能力做成可以直接调用的标准组件。只在通用模型外面增加行业提示词、知识库和几个连接器,已经很难证明产品的不可替代性。

但这并不意味着基础模型已经解决了金融行业。独立测试中,领先模型在复杂金融任务上的严格完整正确率仍不足 50%;Anthropic 提供的金融 Agent 也明确要求,所有结果必须由专业人员审核后才能使用。

平台厂商正在快速解决“AI 能不能做金融工作”,企业真正需要解决的却是另一件事:它能否稳定完成、出错后能否被发现,最终结果由谁负责。

垂直 AI 的壁垒并没有消失,只是从“比模型更懂行业”,迁移到了“能够对行业结果负责”。

一、基础模型厂商带走的,不只是模型能力

要理解这轮变化对垂直 AI 产品的影响,不能只看 Anthropic 又增加了几个金融功能,而要看它究竟把哪些能力打包进了 Agent。

根据 Anthropic 公布的架构,一套金融 Agent 主要由三部分组成:Skills、Connectors 和 Subagents。Skills 负责提供任务说明、行业知识和操作方法;Connectors 让 Agent 在权限控制下读取金融数据库和企业系统;Subagents 则承担可比公司筛选、方法检查等具体环节。三者组合后,Agent 才能完成从获取数据、执行分析到生成材料的完整任务。

以投行 Pitch Agent 为例,用户提供目标公司后,它可以筛选可比公司、分析历史交易,并生成符合模板要求的 Excel 模型和 PowerPoint 材料。企业既可以把它安装在 Claude Cowork 或 Claude Code 中,由分析师边使用边审核,也可以通过 Managed Agents 部署到自己的工作流中,处理持续时间更长的任务。

这套架构值得关注的地方,在于它把过去垂直 AI 团队经常用来证明自身价值的能力,拆成了可以复用的标准组件。

行业知识不再只能藏在提示词里,而是可以被整理成随任务加载的 Skills;数据接入不再需要每个产品从头开发,而是可以通过连接器和 MCP 协议复用;就连任务拆解和多 Agent 协作,也可以直接从官方模板开始修改。企业面对的选择,正在从“是否组建团队开发金融 Agent”,变成“选择哪个模板,再做多少适配”。

OpenAI 也在沿着相似方向推进。2026年6月,OpenAI 发布了 6 类角色插件,共包含 62 个应用和 110 项 Skills。其中,股票研究插件可以连接 FactSet、LSEG、S&P、PitchBook 等数据来源,协助用户分析财报、比较公司和跟踪投资逻辑;投资银行插件则可以完成可比交易分析、尽职调查整理和客户材料准备。OpenAI 官方将这些插件定义为可继续定制的角色工作流,而不只是几个固定的问答功能。

这些产品发布不能直接证明,基础模型厂商已经比所有金融 AI 公司做得更好。官方展示的是能力范围,不是不同业务环境中的真实交付效果。但它至少说明了一件事:基础模型厂商已经不满足于提供模型接口,而是在继续向行业工作流、数据连接和最终成果延伸。

对垂直 AI 产品经理来说,竞争对手也不再只是另一家行业创业公司,还包括基础平台随时可能上线的默认能力。判断一个项目是否值得投入时,不能只问“模型能不能理解这项金融任务”,还要再问一句:如果客户明天安装一个现成的金融插件,我们的产品还剩下什么?

依赖公开行业知识、通用数据和标准流程形成的差异,正在迅速缩小。更麻烦的是,许多垂直产品寄予厚望的私有数据、系统连接和部署服务,也未必天然构成下一道壁垒。

二、数据、连接器和私有部署,未必都是壁垒

当行业知识和标准工作流逐渐变成平台能力后,垂直 AI 产品通常会把差异转向另外三个方向:私有数据、系统连接和企业级部署。

这些能力当然有价值。金融机构不会只让模型依赖公开网页回答问题,Agent 需要读取行情、财报、研究材料和客户信息,也要在权限允许的范围内连接 CRM、知识库和业务系统。但有价值,不等于能够形成长期壁垒。

先看连接器。过去,为每个企业系统单独开发接口,需要处理认证方式、数据格式和调用规则,确实是一项成本不低的工作。MCP 等开放协议出现后,开发者可以按照相对统一的方式,把数据源和工具提供给不同 AI 产品。Anthropic 推出 MCP 时,给出的目标就是用一种开放标准替代分散的定制连接,降低 AI 系统接入新数据源的难度。

这意味着,“我们接入了某个系统”会逐渐从产品优势变成基本能力。连接器仍然需要开发和维护,但如果竞争对手可以调用相同接口,客户也可以把它接到其他模型上,单纯拥有这条数据通道就很难构成稳定差异。

金融数据也存在类似问题。接入 FactSet、LSEG 或 PitchBook,可以明显提高产品的专业性,却不等于获得了独家数据。其他产品只要购买相同服务,也能访问相近的信息。真正难复制的部分往往发生在连接之后:同一个字段在企业内部如何定义,多个来源出现冲突时采用哪个口径,哪些用户能查看,哪些结果允许写回业务系统,以及历史数据如何与最终决策关联。

私有部署同样需要区分。它能够解决数据安全、内部采购和合规要求,是金融机构选择供应商时的重要条件。但私有部署主要回答“系统能否被企业接受”,并不直接回答“为什么客户只能选择这款产品”。当云厂商和基础模型平台也开始提供权限管理、数据隔离和审计功能时,部署方式本身很难长期保持稀缺。

更值得警惕的是,有些产品把大量定制实施误认为行业壁垒。每签下一家客户,就重新接接口、整理知识库、修改提示词和配置流程,确实能够产生收入,也能让产品看起来非常贴近业务。但如果这些工作不能沉淀为下一位客户可以复用的能力,公司积累的主要是项目经验和人力成本,而不是可以持续放大的产品优势。

因此,判断一项能力是不是壁垒,可以先区分它属于哪一类:

这一区分并不是说连接器和私有部署不重要。它们决定产品能否进入客户环境,却未必决定产品进入之后能留下什么。

真正值得积累的私有数据,也不只是企业拥有而外部没有的数据文件。只有当数据经过权限划分、质量处理和业务解释,并持续与人工修改、任务结果和异常情况建立联系时,它才会逐渐变成竞争对手难以直接购买的资产。

问题因此再次向前推进:如果行业知识可以打包、数据接口可以标准化、部署能力也会逐渐普及,垂直 AI 还有什么是基础平台短期内难以替代的?

答案隐藏在模型最不稳定,也最容易产生业务损失的环节里。

三、模型会做金融任务,不等于企业敢让它负责

当行业知识、数据连接和部署能力逐渐普及时,垂直 AI 仍然存在一个基础平台没有解决的问题:模型能够完成一次任务,不代表它能够持续、稳定地交付业务结果。

Vals AI 在 2026 年 8 月发布的 Finance Agent v2,使用 927 个经过专家审核的问题,测试模型读取上市公司文件并完成金融分析的能力。在允许部分得分的口径下,表现最好的模型准确率为 58.63%;当答案必须完整正确时,最高分下降到 47.71%。金融建模与先例交易分析更加困难,类别最高分分别只有 34.14% 和 36.37%。

这些数字不能被简单解释为“AI 做一半金融任务都会失败”。测试集中在特定类型的上市公司研究任务,四项数据的统计口径也不完全相同。它真正说明的是:模型已经可以处理信息检索、摘要和部分定量分析,但任务一旦要求跨文件核对、遵循行业口径并保持中间数字准确,错误会在多个步骤中累积。一个看起来完整的最终答案,可能只是在某个计算环节少考虑了一项调整。

Anthropic 对自己发布的金融 Agent 也设置了明确边界。其开源仓库说明,这些 Agent 可以生成模型、备忘录、研究报告和对账材料,却不能直接提供投资建议、执行交易、批准开户或向账簿记账,所有输出都要交由具备资质的专业人员确认。官方给出的实际定位仍然是“生成待审核的工作成果”,而不是独立承担金融业务。

这并不只是厂商为了降低责任而增加的一句声明。FINRA 在 2026 年度监管报告中指出,金融 Agent 可能出现超出用户授权范围、难以追踪决策过程、错误处理敏感数据以及缺少行业知识等问题。对于使用 Agent 的机构,报告建议记录提示词与输出、追踪模型版本、持续监控结果,并在必要环节设置人工确认和行为限制。

因此,金融 Agent 的可靠性不能只看模型排行榜。模型准确率回答的是“它一般能做到什么程度”,产品需要回答的则是另外一组问题:这一次结果引用了哪些数据,关键数字由谁检查,模型升级后原有任务是否退化,Agent 越权调用工具时如何中止,错误结果是否已经被写入下游系统。

在普通聊天产品中,一次错误回答可能只会让用户重新提问;在金融工作流中,一次未被发现的错误可能进入客户材料、风险判断或财务记录。二者使用的可以是同一个模型,承担的产品责任却完全不同。

这也是垂直 AI 尚未被基础平台完全覆盖的空间。客户采购的不能只是一个更懂金融的模型,还需要一套能够限制权限、验证结果、保存证据并处理异常的系统。

只有当模型的能力被放进这套系统中,企业才可能把真实工作交给它。垂直 AI 下一阶段真正需要建立的,也正是一套围绕结果运行的责任机制。

四、垂直 AI 真正的壁垒,是一套结果责任系统

如果金融 Agent 的核心难题是结果能否被验证,那么垂直 AI 产品需要积累的,就不只是更多提示词和行业资料,而是一套围绕结果运行的责任系统。这套系统至少包含三部分。

第一部分是业务语义与权限。

连接器可以告诉 Agent 去哪里读取数据,却不会自动告诉它数据在业务中代表什么。不同部门可能对同一个指标采用不同口径,相同名称的字段也可能对应完全不同的计算方式。垂直产品需要明确数据来源、优先级和适用范围,并把这些规则转化为 Agent 可以执行的约束。

权限也不能停留在“用户是否登录”。产品还要区分 Agent 可以读取什么、可以生成什么、是否允许写回系统,以及一次任务能够调用多少数据。例如,同样是处理客户材料,读取公开财报与读取客户账户信息对应的风险完全不同;生成一份待审核草稿与直接向客户发送,也不应该使用相同权限。

第二部分是评估数据与异常经验。

基础模型的能力会持续变化,但新模型在公开排行榜上得分更高,不代表它在企业自己的流程中一定更可靠。垂直产品需要针对真实任务建立评估集,把正确数据来源、计算口径、必要字段和允许误差写成可检查的标准。每次更换模型、修改提示词或增加工具后,都要重新运行测试。

Morgan Stanley 在应用生成式 AI 时,并没有只依赖模型厂商提供的通用评测。它为不同用例建立专家评估集,并使用日常回归测试检查系统表现。会议纪要和后续内容还要由金融顾问审核后才能正式使用。这一案例真正值得参考的,不是某个模型带来了多少效率,而是企业把专家判断转化成了能够重复执行的质量标准。

用户对错误结果的修改同样重要。如果系统能够记录哪些数字经常出错、哪些文件容易被误读、哪些任务总是需要人工补充,那么客户使用越多,产品对异常情况的理解就越完整。这类经验无法通过购买一个新模型立即获得,也是垂直产品最有可能持续积累的资产。

第三部分是审批节点与责任记录。

人工参与并不意味着每一步都要重新审核,否则 Agent 只会把原来的工作换一种方式再做一遍。产品需要根据结果风险设置不同权限:低风险的信息整理可以自动完成;涉及客户材料、业务判断和数据写回的任务,需要在关键节点暂停并请求确认;交易执行、开户批准等高风险动作,则可能根本不应交给 Agent。

同时,系统要保存任务使用的数据、模型版本、工具调用、人工修改和最终确认人。这样做不仅是为了满足审计要求,也是为了在错误发生后判断问题来自模型、数据、规则还是人工操作。

产品经理可以用两个维度判断一项任务值得投入多少垂直能力:任务的标准化程度,以及错误结果可能造成的影响。标准化程度高、结果风险低的资料摘要和信息提取,可以优先使用成熟平台;标准化程度高但风险较大的对账与 KYC 审查,需要增加确定性校验和人工审批;流程差异大、结果风险又高的复杂金融判断,才值得建设完整的垂直责任系统。

因此,评估一个垂直 Agent 项目时,可以连续追问五个问题:出错后由谁发现?哪些动作必须审批?模型升级后如何判断效果?客户使用越多,产品积累了什么?如果明天替换基础模型,产品还剩下什么?

能够回答这些问题的产品,才可能把模型能力转化为企业愿意长期使用的业务能力。垂直 AI 真正难以复制的部分,不是让 Agent 第一次把任务做出来,而是让它在真实环境中持续工作,并让每一次结果都可以被验证、被控制和被追责。

结语:不要再做一个“更懂金融的聊天机器人”

Anthropic 推出10套金融 Agent,OpenAI 把股票研究和投资银行工作流做成角色插件,并不意味着垂直 AI 产品已经失去机会。它真正改变的,是垂直产品成立的最低标准。

行业知识、公开数据、通用提示词和标准工作流正在被基础平台快速吸收。一个产品如果只是让通用模型换上金融术语、接入几个数据库,再套上一层聊天界面,即使今天能够满足部分需求,也很难阻止平台厂商在下一次更新中覆盖相同能力。

但基础平台能够提供一套通用的金融工作方法,无法直接承担每家企业的业务结果。不同公司的数据口径、风险政策、审批规则和责任划分不会因为模型升级而自动统一。模型越有能力进入真实流程,企业越需要知道它能访问什么、在哪里必须停下、结果如何验证,以及出错后由谁负责。

这也是垂直 AI 产品仍然值得做的地方。

与其从“金融行业足够大”出发,重新做一个无所不答的金融助手,不如选择一个边界清楚的具体任务:它有稳定的输入和输出,结果能够被检查,错误会产生明确影响,人工修改也可以持续沉淀。产品首先解决这一个流程中的数据语义、质量标准、审批节点和异常处理,再考虑向相邻任务扩展。

相应地,产品指标也不能只看调用次数和回答满意度。一次通过率、人工修改时间、关键错误发现率、异常处理成功率和责任记录完整度,更能说明 Agent 是否真正进入了业务。

基础模型厂商会继续扩大能力范围,今天看起来专业的金融功能,明天可能就会成为平台默认配置。垂直 AI 无法通过比平台多写几条行业规则长期取胜。

下一代垂直产品真正要证明的,不是自己的模型更像一名金融专家,而是企业为什么敢把一项真实工作长期交给它。

本文由 @超级土豆饼儿 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!